墨码
音视频

语音交互机制

围绕实时语音交互中的关键控制与工程机制展开,介绍语音活动检测、端点检测、语音唤醒、话轮管理、语音打断、会话状态控制,以及 WebSocket 心跳检测、断线重连、缓冲与流量控制等机制,说明它们如何共同保证语音交互的连续性、实时性与稳定性。

SUN·0 字·1 分钟
语音交互机制
标签:语音

相关阅读

音视频·

语音识别

系统介绍自动语音识别(ASR)的基本原理与技术演进,涵盖语音分帧、时频分析、频谱与语谱图、Filter Bank、Log-Mel、MFCC 等声学表示,以及模板匹配、DTW、HMM-GMM、DNN-HMM、CTC、Attention、Transformer 和 Conformer 等典型识别方法与模型。

0 字 · 1 分钟
音视频·

Web 语音技术

系统梳理 Web 语音技术的发展脉络、系统架构与技术选型,帮助读者建立整体认知,并为后续专题内容提供阅读导览。

8376 字 · 39 分钟
音视频·

技术选型与部署

从工程落地角度比较 Web 语音系统的主要技术方案,涵盖浏览器原生语音能力、开源语音模型、云语音服务,以及浏览器端、本地服务、云端服务和混合部署方式,并结合实时性、准确率、成本、隐私、资源需求与开发复杂度分析不同方案的适用场景。

0 字 · 1 分钟
音视频·

音频采集与处理

系统介绍 Web 语音系统的音频采集与处理流程,涵盖声音数字化、浏览器音频采集、音频处理及实时传输等核心技术。

8371 字 · 39 分钟
音视频·

语义理解与任务处理

介绍语音识别结果进入业务系统后的理解与执行过程,涵盖用户意图识别、实体与槽位提取、上下文与多轮对话管理、任务路由、业务接口调用,以及大语言模型、检索增强和工具调用在现代语音交互系统中的作用与实现方式。

0 字 · 1 分钟
音视频·

语音合成

系统介绍文本到语音(TTS)的基本处理流程与模型演进,涵盖文本处理、声学表示、声学模型、声码器,以及拼接式、统计参数式和神经网络语音合成方法,并说明合成音频在 Web 环境中的传输、缓冲与浏览器播放方式。

0 字 · 1 分钟