一、背景
2026年6月5日,通义实验室正式开源了 PawBench v1.0,这是一个面向通用智能体的系统化评测基准。
与传统的模型评测不同,PawBench 的核心创新点在于:它不是单纯评测模型,而是评测「模型 × 框架 × 任务」三者的组合表现。
评测覆盖了9个主流大模型、3款智能体框架(Qwenpaw、Openclaw、Hermes)、150道真实世界任务,总共4050个测试单元。
本文基于这份评测数据,我们来聊聊一个核心问题:**Harness(驾驭工程对智能体的最终表现,到底有多大影响?
二、核心发现
2.1 框架之间的差距,远超预期
多模型平均结果显示,不同框架之间的得分差距达到了6.4分。
| Qwenpaw | 76.4 |
| Openclaw | 75.4 |
| Hermes | 70.4 |
6.4分是什么概念?大致相当于一次模型小版本迭代的提升幅度。
而如果单看特定模型,差距会更大。例如 qwen3.6-35b-a3b 在不同框架下的得分差距达到了 **11.5分——这已经接近模型代际差距的水平。
这说明:同样的模型,放在不同的框架里运行,最终表现可以天差地别。
2.2 组合效应:小模型 + 好框架 vs 大模型 + 差框架
评测中一个有意思的现象是:
| Qwen3.6-35b-a3b + Qwenpaw | 70.4 |
| GLM 5.1 + Hermes | 68.2 |
需要说明的是,这是两个变量同时变化的对比(模型不同,框架也不同),不能简单归因到框架身上。
但它至少说明了一个趋势:框架的影响力,大到足以在一定程度上拉平模型参数的代差。
PawBench团队也给出的官方结论是:Harness对最终表现有显著影响,好的Harness能让模型能力得到更充分地发挥。
当然,他们也明确了边界:**Harness能指路,但能不能走通,最终仍考验底座模型的能力。二者是互补关系,不是替代关系。
2.3 Agent任务中,模型差距被缩小
评测还发现一个值得关注的现象:
- 在纯文本生成任务中,不同模型的差距很大;
- 但在真实Agent任务中,模型间的差距被大幅缩小;
- 框架设计的优劣,成为影响最终表现的重要变量。
这背后的原因不难理解:Agent任务是一个系统工程,不是光模型只是其中一个环节。prompt设计、工具调用方式、状态管理、错误处理……每个环节都会影响最终结果。
当模型能力都达到一定门槛后,**系统工程能力的重要性就会凸显出来。
三、四项框架设计原则
基于4050组对照实验,PawBench团队总结了智能体框架设计的四项核心原则。
3.1 充分告知(Full Disclosure)
让模型获得完整的情境感知。
很多Agent的prompt设计存在信息密度很低——工具列表散落在自然语言描述中,任务状态散落在对话历史里,模型需要自己梳理才能获取关键信息。
更好的做法是:
- 工具清单结构化呈现
- 每一步执行前,显式注入当前全局状态
- 历史执行结果做结构化摘要,而非原始输出堆砌
在Spring AI Graph中,这对应State的设计——用清晰的状态结构承载上下文。
3.2 按需装备(On-demand Equip)
工具不是越多越好,而是在正确的时机给正确的工具。
一个常见的误区是:给Agent装上尽可能多的工具,以为这样能力就强。
实际效果往往相反:
- 工具太多 → 选择成本升高 → 选错工具
- 工具定义占用大量上下文 → 留给任务的空间减少
- 模型注意力分散 → 执行质量下降
行业内的普遍经验是:砍掉大部分不常用的工具,只保留核心工具,Agent的成功率反而会提升。
正确的做法是动态工具加载:根据任务阶段和当前状态,动态决定给模型暴露哪些工具。
在Spring AI Graph中,这对应不同的Node加载不同的工具集。
3.3 主动监控(Active Monitoring)
框架不能是黑盒传送带,要有独立的质量检查站。
很多Agent系统是"一站式的:给一个任务,模型自己执行到底,中间有没有走偏、有没有出错,全靠最后结果倒推。
主动监控就是在关键路径上设置检查站:
- 工具调用后,校验返回结果有效性
- 每执行N步,做一次方向性检查
- 最终输出前,做质量校验
检查站不一定要用大模型,可以是规则、小模型或状态校验。核心是执行和监控分离。
在Spring AI Graph中,这对应Supervisor节点的设计。
3.4 弹性恢复(Resilient Recovery)
出错是常态,框架要能自己恢复。
生产级Agent和玩具Agent的区别,不在于从不犯错,而在于:
- 工具调用失败 → 有没有重试机制
- 上下文溢出 → 有没有压缩策略
- 状态异常 → 有没有回滚机制
- 陷入循环 → 有没有熔断机制
这些都和模型能力无关,是纯粹的工程能力。
在Spring AI Graph中,这对应异常分支、重试节点、条件回退、循环限制等基础设施。
四、对行业的启示
4.1 智能体竞争,正在从模型竞赛转向系统竞赛
过去几年,行业的注意力主要集中在模型上:参数规模、上下文长度、推理速度……
但PawBench的结果说明:当模型能力达到一定门槛后,系统工程能力的重要性越来越突出。
未来的Agent竞争,比拼的不只是谁的模型强,更是谁的系统设计得好、谁的工程更扎实。
4.2 Harness工程师正在成为新工种
在 PawBench v1.0 的语境下,Harness 指的是 智能体的运行框架(Agent Execution Harness),也可以理解为 智能体的工程实现层。
前两年流行的"prompt工程师"正在快速贬值——模型越来越聪明,对prompt的宽容度越来越高。
而Harness工程师正在成为新的稀缺人才:
- 懂模型能力边界,但不需要懂微调
- 懂系统设计,能把模型能力工程化
- 懂状态管理、异常处理、可观测性
- 目标是让模型能力在真实场景中稳定释放
4.3 后端开发者的机会
对于Java/后端开发者来说,这是一个好消息。
Harness工程,本质上就是软件工程。状态机设计、模块化架构、异常处理、并发调度、监控告警……这些都是后端开发者天天在做的事情。
你不需要跟算法工程师比谁更懂模型内部原理。你要比的是谁能把模型的能力更好地工程化、产品化、落地到真实业务里。
这就是后端开发者转AI Agent的差异化优势。
五、总结
PawBench的价值,不只是多了一个评测榜单。
它让我们更清晰地看到了智能体的本质:**智能体的能力,不等于模型的能力。
模型是发动机,Harness是传动系统、车架、刹车、方向盘。没有好的整车工程,再强的发动机也跑不快、跑不远。
对于想进入AI Agent领域的开发者来说,这是一个重要的信号:
你的工程经验,就是你最大的护城河。
参考资料:
- PawBench 官方开源仓库(通义实验室,2026.6.5)





