欢迎光临
我们一直在努力

Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR

在这里插入图片描述

文章主要内容总结

本文聚焦于多语言对话式自动语音识别(ASR)任务,提出了一种融合语言特定双向上下文的语音大语言模型(SLLM),以提升多语言连续对话语音识别性能。具体而言:

  • 模型架构:采用后对齐设计,结合Whisper-large-v3语音编码器、线性投影器(作为模态适配器)和Gemma-2-2B大语言模型(LLM)作为骨干,训练时冻结语音编码器,微调线性投影器和LLM。
  • 训练策略:引入字符级上下文掩码策略,随机移除部分上下文,模拟推理时可能出现的错误转录,增强模型鲁棒性。
  • 推理流程:采用两阶段解码 pipeline,第一阶段独立解码每个片段生成初始假设,第二阶段利用邻域假设作为上下文进行重解码,提升识别连贯性。
  • 实验结果:在涵盖11种语言的1500小时MLCSLM语料上,相对性能较基线提升18%,甚至超过使用6000小时数据训练的模型,验证了上下文信息对多语言对话ASR的显著增益。

创新点

  • 语言特定提示(Language-specific prompts):为不同语言设计专属提示,增强模型的多语言处理能力。
  • 双向上下文融合
  • 赞(0)
    未经允许不得转载:171主机测评 » Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址