首页文章音视频语义理解与任务处理音视频语义理解与任务处理介绍语音识别结果进入业务系统后的理解与执行过程,涵盖用户意图识别、实体与槽位提取、上下文与多轮对话管理、任务路由、业务接口调用,以及大语言模型、检索增强和工具调用在现代语音交互系统中的作用与实现方式。SUN·发布于 2023年2月28日·0 字·1 分钟标签:语音 上一篇语音识别下一篇 语音合成相关阅读音视频·2026年6月19日语音识别系统介绍自动语音识别(ASR)的基本原理与技术演进,涵盖语音分帧、时频分析、频谱与语谱图、Filter Bank、Log-Mel、MFCC 等声学表示,以及模板匹配、DTW、HMM-GMM、DNN-HMM、CTC、Attention、Transformer 和 Conformer 等典型识别方法与模型。0 字 · 1 分钟音视频·2026年2月20日Web 语音技术系统梳理 Web 语音技术的发展脉络、系统架构与技术选型,帮助读者建立整体认知,并为后续专题内容提供阅读导览。8376 字 · 39 分钟音视频·2025年3月10日技术选型与部署从工程落地角度比较 Web 语音系统的主要技术方案,涵盖浏览器原生语音能力、开源语音模型、云语音服务,以及浏览器端、本地服务、云端服务和混合部署方式,并结合实时性、准确率、成本、隐私、资源需求与开发复杂度分析不同方案的适用场景。0 字 · 1 分钟音视频·2024年2月23日音频采集与处理系统介绍 Web 语音系统的音频采集与处理流程,涵盖声音数字化、浏览器音频采集、音频处理及实时传输等核心技术。8371 字 · 39 分钟音视频·2022年3月2日语音合成系统介绍文本到语音(TTS)的基本处理流程与模型演进,涵盖文本处理、声学表示、声学模型、声码器,以及拼接式、统计参数式和神经网络语音合成方法,并说明合成音频在 Web 环境中的传输、缓冲与浏览器播放方式。0 字 · 1 分钟音视频·2021年3月7日语音交互机制围绕实时语音交互中的关键控制与工程机制展开,介绍语音活动检测、端点检测、语音唤醒、话轮管理、语音打断、会话状态控制,以及 WebSocket 心跳检测、断线重连、缓冲与流量控制等机制,说明它们如何共同保证语音交互的连续性、实时性与稳定性。0 字 · 1 分钟
音视频·2026年6月19日语音识别系统介绍自动语音识别(ASR)的基本原理与技术演进,涵盖语音分帧、时频分析、频谱与语谱图、Filter Bank、Log-Mel、MFCC 等声学表示,以及模板匹配、DTW、HMM-GMM、DNN-HMM、CTC、Attention、Transformer 和 Conformer 等典型识别方法与模型。0 字 · 1 分钟
音视频·2025年3月10日技术选型与部署从工程落地角度比较 Web 语音系统的主要技术方案,涵盖浏览器原生语音能力、开源语音模型、云语音服务,以及浏览器端、本地服务、云端服务和混合部署方式,并结合实时性、准确率、成本、隐私、资源需求与开发复杂度分析不同方案的适用场景。0 字 · 1 分钟
音视频·2022年3月2日语音合成系统介绍文本到语音(TTS)的基本处理流程与模型演进,涵盖文本处理、声学表示、声学模型、声码器,以及拼接式、统计参数式和神经网络语音合成方法,并说明合成音频在 Web 环境中的传输、缓冲与浏览器播放方式。0 字 · 1 分钟
音视频·2021年3月7日语音交互机制围绕实时语音交互中的关键控制与工程机制展开,介绍语音活动检测、端点检测、语音唤醒、话轮管理、语音打断、会话状态控制,以及 WebSocket 心跳检测、断线重连、缓冲与流量控制等机制,说明它们如何共同保证语音交互的连续性、实时性与稳定性。0 字 · 1 分钟