欢迎光临
我们一直在努力

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

该文章提出了首个基于真实中文语音的音频语言模型(LALMs)评估基准VCB Bench,解决现有基准的局限性,同时通过实验揭示了当前LALMs的性能差距与改进方向。

一、文章主要内容

  • 研究背景:现有LALMs评估基准存在三大局限,一是以英语为中心,缺乏中文覆盖;二是依赖合成语音,无法反映真实声学差异;三是源于文本数据集,不适合口语化对话评估,而中文语音交互需求迫切,需针对性基准。
  • VCB Bench构建
    • 核心维度:从指令遵循、知识理解、鲁棒性三方面评估。指令遵循含文本/语音指令及多轮对话,支持双语;知识理解涵盖12学科常识、数理推理等;鲁棒性测试内容、环境、说话人特征扰动下的稳定性。
    • 数据集来源:整合第三方专业录音、综艺问答音频、内部双人对话数据集,经人工筛选与GPT – 4o质量评估,确保真实性与高质量。
  • 实验与结果
    • 模型评估:对9个主流LALMs(如GPT – 4o – Audio、Mimo – Audio等)测试,发现GPT – 4o – Audio综合表现最优,开源模型各有优势(如Mimo – Audio擅长推理,StepAudio2Mini擅长中文对话),但跨语言、跨模态对齐存在不足。
    • 关键发现:语音速率变化、声学回声对模型鲁棒性影响最大;内容级干扰(如语法错误)影响较小;
  • 赞(0)
    未经允许不得转载:171主机测评 » VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址