
文章主要内容总结
本文聚焦于多语言对话式自动语音识别(ASR)任务,提出了一种融合语言特定双向上下文的语音大语言模型(SLLM),以提升多语言连续对话语音识别性能。具体而言:
- 模型架构:采用后对齐设计,结合Whisper-large-v3语音编码器、线性投影器(作为模态适配器)和Gemma-2-2B大语言模型(LLM)作为骨干,训练时冻结语音编码器,微调线性投影器和LLM。
- 训练策略:引入字符级上下文掩码策略,随机移除部分上下文,模拟推理时可能出现的错误转录,增强模型鲁棒性。
- 推理流程:采用两阶段解码 pipeline,第一阶段独立解码每个片段生成初始假设,第二阶段利用邻域假设作为上下文进行重解码,提升识别连贯性。
- 实验结果:在涵盖11种语言的1500小时MLCSLM语料上,相对性能较基线提升18%,甚至超过使用6000小时数据训练的模型,验证了上下文信息对多语言对话ASR的显著增益。



