该文章提出了首个基于真实中文语音的音频语言模型(LALMs)评估基准VCB Bench,解决现有基准的局限性,同时通过实验揭示了当前LALMs的性能差距与改进方向。
一、文章主要内容
- 核心维度:从指令遵循、知识理解、鲁棒性三方面评估。指令遵循含文本/语音指令及多轮对话,支持双语;知识理解涵盖12学科常识、数理推理等;鲁棒性测试内容、环境、说话人特征扰动下的稳定性。
- 数据集来源:整合第三方专业录音、综艺问答音频、内部双人对话数据集,经人工筛选与GPT – 4o质量评估,确保真实性与高质量。
- 模型评估:对9个主流LALMs(如GPT – 4o – Audio、Mimo – Audio等)测试,发现GPT – 4o – Audio综合表现最优,开源模型各有优势(如Mimo – Audio擅长推理,StepAudio2Mini擅长中文对话),但跨语言、跨模态对齐存在不足。
- 关键发现:语音速率变化、声学回声对模型鲁棒性影响最大;内容级干扰(如语法错误)影响较小;





