欢迎光临
我们一直在努力

Embodied‑BenchForge:面向具身智能评测基准构建的闭环智能体工作流

Embodied‑BenchForge:面向具身智能评测基准构建的闭环智能体工作流

原文网页:https://arxiv.org/html/2609.13082v1

摘要 智能体系统为自动化构建具身评测基准提供了可行路径,但现有方案大多只能覆盖局部流程,且高度依赖预定义环境与任务集合。更关键的是,多步骤构建流程会产生存在依赖关系的中间制品;中间缺陷会不经校验直接向下游传递,污染最终基准。本文提出Embodied‑BenchForge,一套智能体框架,可以将用户指定的评测意图,完整转化为可执行的具身评测基准制品。本文将基准构建形式化为闭环基准合成(Closed‑Loop Benchmark Synthesis),融合正向制品合成与反向校验修复两大流程。

  • 技能编排式制品合成:将类型化、可复用的技能组合成可执行工作流,同时维护制品依赖图,记录中间输出与相互依赖;
  • 需求引导的校验与修复:为每一类制品绑定专属需求契约;校验失败时,依托溯源信息触发局部重执行或者上游回滚。

Embodied‑BenchForge产出两套评测赛道:离线问答赛道OE‑Track包含6套异构具身基准;交互式具身赛道IE‑Track包含220个完整可执行任务。对主流多模态大模型、具身智能体开展评测,证明该基准可以有效区分观测理解能力与闭环交互执行能力。质量评估、多组消融实验验证了基准质量以及校验‑修复模块的有效性;技能复用与修复案例分析证明框架具备局部恢复、跨基准复用能力。

关键词 具身AI;评测基准自动化构建;智能体工作流;闭环校验修复;技能编排

目录

  • 引言
  • 相关工作
    • 2.1 具身基准与任务生成
    • 2.2 自动化基准构建与校验
  • Embodied‑BenchForge框架
    • 3.1 总览
    • 3.2 技能编排式制品合成
    • 3.3 需求引导的校验与修复
  • 产出基准套件
  • 实验
    • 5.1 实验设置
    • 5.2 评估指标
    • 5.3 效率指标
    • 5.4 构建质量与构建效率
      • 5.4.1 制品质量
      • 5.4.2 构建效率
    • 5.5 基准评测效用
      • 5.5.1 离线问答OE性能
      • 5.5.2 交互式具身任务性能
    • 5.6 构建机制消融实验
      • 5.6.1 技能复用分析
      • 5.6.2 系统级消融
      • 5.6.3 流程质量控制消融
      • 5.6.4 跨赛道能力诊断
  • 结论
  • 参考文献
  • 附录A OE/IE双赛道闭环质量控制
    • A.1 定义与共享闭环协议
      • A.1.1 制品专属需求契约
      • A.1.2 赛道专属质量关卡
      • A.1.3 溯源引导修复协议
    • A.2 离线问答赛道:校验与修复案例
    • A.3 交互式具身赛道:执行与校验
  • 附录B 资源覆盖度与跨资源适配
  • 附录C 技能分类体系与复用统计
  • 附录D 构建开销与效率分析
  • 附录E 实验细节与扩展结果
  • 1 引言

    多模态大模型、视觉‑语言‑动作模型推动具身智能从单纯感知,拓展到空间推理、任务规划、闭环交互。对应的具身评测基准覆盖问答、导航、家庭机器人操作等场景。可靠评测是定位模型能力边界的关键,但基准构建工作高度依赖人工。

    现有自动化基准构建方案存在两大核心痛点:

  • 强绑定特定环境:大多只能工作在预定义模拟器、固定任务家族;具身任务会用到图像、视频、轨迹、模拟器接口,输出包含问题、参考答案、任务指令、可执行验证器。把一份评测意图转化为整套异构制品,仍需要大量人工配置。
  • 中间缺陷向下传播:基准构建包含源数据处理、证据抽取、状态结构化、任务合成、答案推导、验证器编写等一系列存在依赖关系的操作。缺少针对每一类制品的校验,中间环节错误会流入下游;仅在最终阶段做检查会浪费大量计算资源,全部重新生成又会丢弃已经校验通过的制品。
  • 核心方案:闭环基准合成 Closed‑Loop Benchmark Synthesis。将正向的制品合成流程,和反向的校验、定位、局部修复结合。

    • 正向:技能编排式制品合成,把构建操作封装为类型化可复用技能,依据评测意图组合成可执行工作流;维护制品依赖图,记录全部中间输出与依赖关系。
    • 反向:需求引导的校验修复,为每类制品绑定结构、语义、执行类需求契约;校验失败时依托溯源信息,执行局部修复/上游回滚,仅重建受影响下游制品,保留其余已经校验通过的制品。

    本文产出两套评测赛道:

  • OE‑Track(Offline EQA 离线具身问答赛道):6套基准,覆盖家庭机器人、移动机器人、自动驾驶、机械臂、无人机、四足机器人;
  • IE‑Track(Interactive Embodied交互式具身赛道):220个可执行交互任务,具备可恢复初始环境状态、动作接口、目标条件、终端验证器,同时保留交互轨迹,可支持轨迹问答。
  • 评测11套开源/闭源模型,实验证明:该基准可以有效区分模型的观测理解能力和闭环执行完成任务能力。

    本文贡献

  • 提出Embodied‑BenchForge智能体框架,支持将用户评测意图,端到端生成异构的具身评测基准制品。
  • 提出闭环基准合成范式:类型化技能编排合成 + 制品级需求契约 + 溯源引导局部修复/回滚。
  • 构建OE‑Track、IE‑Track两套完整基准套件;大量实验验证制品质量、构建效率、技能复用性,揭示具身理解与闭环交互之间显著的模型能力鸿沟。
  • 方法
    端到端合成
    可复用模块
    异构资源支持
    可执行制品
    流程级校验修复
    AutoBencher
    BenchAgents
    Code2Bench
    RoboGen
    A2Eval
    Embodied‑BenchForge

    ✅完整支持;△部分支持;‑不支持。△代表仅有校验,不支持选择性局部重建。

    2 相关工作

    在这里插入图片描述

    2.1 具身基准与任务生成

    经典具身基准:ALFRED、LIBERO、EmbodiedScan、EmbodiedBench、OpenEQA,覆盖场景理解、导航、机器人操作。这些基准质量高,但构建绑定特定模拟器、资源与schema。 自动化生成方向:ProcTHOR、RoboCasa生成场景;MimicGen生成机器人演示;Eureka/RoboGen用大模型生成任务与奖励函数。这类方案局限于固定模拟器内部,无法从用户高层评测意图出发,端到端产出完整基准包。

    2.2 自动化基准构建与校验

    Dynabench、BenchBuilder、AutoBencher依靠人机交互、声明式需求生成NLP评测数据;BenchAgents分阶段智能体工作流;BenchBench引入心理测量学IRT分析;Code2Bench面向软件任务做依赖与覆盖率校验。 具身领域A2Eval是从已有基准做子集筛选,不生成全新可执行任务。 具身基准构建额外要求:观测、环境状态、证据、可行动作、目标、可执行验证器之间保持严格一致性。Embodied‑BenchForge通过可复用构建技能、制品专属需求契约、溯源引导修复解决该问题。

    赞(0)
    未经允许不得转载:171主机测评 » Embodied‑BenchForge:面向具身智能评测基准构建的闭环智能体工作流
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址