墨码
hero

一位 WEB 开发者的
技术笔记 & 思考沉淀

本站主要记录前端、后端与运维相关知识的学习与实践过程,整理技术细节、踩坑经验与个人思考,作为持续成长的记录。

精选

Web 语音技术
音视频·

Web 语音技术

系统梳理 Web 语音技术的发展脉络、系统架构与技术选型,帮助读者建立整体认知,并为后续专题内容提供阅读导览。

8376 字 · 约 39 分钟

最新文章

随笔·

关于本站

「墨 · 码」是一个专注于 Web 开发的个人博客,用来记录学习与开发过程中的探索、思考和总结。

1576 字 · 8 分钟
音视频·

语音识别

系统介绍自动语音识别(ASR)的基本原理与技术演进,涵盖语音分帧、时频分析、频谱与语谱图、Filter Bank、Log-Mel、MFCC 等声学表示,以及模板匹配、DTW、HMM-GMM、DNN-HMM、CTC、Attention、Transformer 和 Conformer 等典型识别方法与模型。

0 字 · 1 分钟
音视频·

Web 语音技术

系统梳理 Web 语音技术的发展脉络、系统架构与技术选型,帮助读者建立整体认知,并为后续专题内容提供阅读导览。

8376 字 · 39 分钟
音视频·

技术选型与部署

从工程落地角度比较 Web 语音系统的主要技术方案,涵盖浏览器原生语音能力、开源语音模型、云语音服务,以及浏览器端、本地服务、云端服务和混合部署方式,并结合实时性、准确率、成本、隐私、资源需求与开发复杂度分析不同方案的适用场景。

0 字 · 1 分钟
音视频·

音频采集与处理

系统介绍 Web 语音系统的音频采集与处理流程,涵盖声音数字化、浏览器音频采集、音频处理及实时传输等核心技术。

8371 字 · 39 分钟
音视频·

语义理解与任务处理

介绍语音识别结果进入业务系统后的理解与执行过程,涵盖用户意图识别、实体与槽位提取、上下文与多轮对话管理、任务路由、业务接口调用,以及大语言模型、检索增强和工具调用在现代语音交互系统中的作用与实现方式。

0 字 · 1 分钟