背景介绍
- 世界现存7168种语言,142个语系。
- 中国汉语方言分为十大方言:官话、晋、吴、闽、客家、粤、湘、赣、徽、平话土话。
- 多语种识别方法包括端到端和多级联式,端到端方法能更好地保留语音信息。
- GPT-4o结合多模态,增强文本、视觉和音频处理能力,实时响应音频输入。
- 豆包语音交互采用动态判停技术。
- 级联式对话模型存在信息丢失、错误累积和高延迟问题。
- 端到端对话模型通过语音编码器将语音离散化,由语言模型直接处理,实现多模态实时输入输出。
- 全双工语音交互允许双方同时发送和接收数据,但并非所有全双工系统都是端到端对话模型。
语音识别大模型
- 语音识别任务为找到对应观察序列的最可能的词序列,需声学模型和语言模型共同决定。
- 语音识别过程包括特征提取、声学模型、语言模型和解码器。
- 语音识别发展史:模板匹配 -> 统计模型 -> 深度学习 -> 大语言模型。
- Transformer模型包含自注意力机制、位置编码和前馈层。
- Conformer模型结合卷积神经网络和Transformer,提高识别性能。
- 大语言模型(LLM)在语音识别中通过适配器与文本对齐,实现next token预测。
- 开源模型Whisper采用Transformer结构,使用大规模弱标签数据进行训练。
- 开源模型FireRedASR采用Conformer编码器和Qwen2-7B-Instruct LLM。
- 开源模型Qwen3-ASR支持30个语种和22个中国方言,采用AED框架和Qwen3 LM。
端到端对话模型
- 端到端对话模型包含语音编码器、大语言模型和语音解码器。
- 语音编码器分为语义Token/特征、声学Token和统一Token。
- 语义Token/特征优先捕捉语音中的内容,如Wav2Vec、HuBERT、Whisper等。
- 声学Token聚焦语音压缩与高保真重建,如SoundStream、EnCodec、TiCodec等。
- 统一Token兼顾语义和声学信息,如Mimi、SpeechTokenizer、X-Codec等。
- 大语言模型包括LLaMA-3.1-8B-Instruct、Helium-7B、GLM-4-9B等。
- 语音解码器将离散Token生成梅尔谱,通过声码器转成波形,关键技术为Flow Matching。
- 典型例子CosyVoice和GLM-TTS采用Flow Matching模型结构。
- 开源模型Moshi、GLM-4-Voice、Qwen-Omni系列、Kimi-Audio、Step-Audio2等。
全双工语音交互
- 全双工语音交互模型需同时具有听和说的能力,实时处理两条音频流。
- 插话打断可通过声学VAD、语义VAD和端到端建模实现。
- 语义VAD包括EasyTurn、Phoenix-VAD和SoulX-Duplug等。
- 全双工模型包括Moshi、PersonaPlex和Covo-Audio等。
落地应用
- 声云语音转写、语音翻译、StepAudio 2.5 Realtime等。
总结与展望
- 语音识别大模型:多语种/方言,BBPE编码,AED/LLM框架。
- 端到端对话模型:Speech Tokenizer/Encoder,LLM,Speech Detokenzier。
- 语音Token:语义、声学、统一Token。
- 关键技术:RVQ,Flow Matching。
- 端到端对话模型:Moshi、GLM-4-Voice、Qwen-Omni系列、Kimi-Audio、Step-Audio2等。
- 语义VAD:EasyTurn、Phonex-VAD、SoulX-Duplug。
- 全双工语音交互:流式打断,Moshi、PersonaPlex、Covo-Audio等。
- 展望:全双工端到端对话模型、语音思维链(CoT)、Voice Agent。