欢迎光临
我们一直在努力

Agent Harness的演进过程

摘要

本文分析了三个时代Agent发展过程来帮助理解Agent Harness形态的演进和未来方向

  • 在 Harness 1.0(Bolt-On 时代),Harness 是外部脚手架—如 ReAct 这样的提示技术、AutoGPT 这样的完全模型自主循环,以及 Cursor/Copilot 这样的人机交互 IDE。Agent的交付能力来自"Harness 需求曲线和模型能力曲线间的差距“。当模型突破能力阈值并诞生了 Claude Code 这样与能力匹配的 Harness 时,便形成了一个划时代交点,使得自主智能体变得可行。
  • 在 Harness 2.0(Co-Training 时代),强化学习移入 Harness 内部,模型开始将 Harness 能力吸收到权重中,工程师们也开始删除冗余脚手架,此时Agent Harness 方向由"在维持同等能力前提下,可以删掉多少 Harness 的原有逻辑"作指标
  • 作者认为我们正进入 Harness 3.0(Attention 时代),Harness留下人类为中心的能力:权限、身份、信任和可解释性,演化为attention-interface:一套可学习进化的接口组件,负责告知Agent 如何与人类协作。作者预测,每个 agentic AI 公司都会发布一个 human attention policy surface,类似于 AGENTS.md 成为标准的方式。
  • 2025 年圣诞节前后,AI 工程师们注意到 Agents 出现了变化:它们终于能用了!但很难精准定位背后的确切原因。或许是模型跨过了某个能力阈值;又或许是模型外面的包装层已经发展成熟。

    本文的核心观点是,上述后两个因素共同促成了这一变化。模型与 Harness 同步迭代提升,二者性能提升曲线恰好在某个时间点交汇。这套演变逻辑也能帮我们预判后续走向:模型不断把 harness 的能力吸纳进权重,工程师把已经被模型吸收的脚手架不断删掉,最终留下来的 Harness 不再服务模型,而是服务人类注意力。

    Transformer 的发明人之一 Lukasz Kaiser 在 6 月的《无监督学习》播客中提到:

    “去年冬天、圣诞节前后发生的变化,很难说清根源到底在哪。Harness 发生了改动,后训练流程也做了小幅调整,又有新预训练模型问世…… 但整体能感受到一次巨大跃升,却很难确定到底是什么带来了这次提升。”

    “到底发生了什么?”答案不能只从模型权重里找,答案藏在围绕权重搭建起的整套系统中

    答案就在 Agent Harness 当中:

    回想 2022 年 11 月,ChatGPT 是当时最顶尖的 AI 工具。它仅具备下一个 token 预测能力,RLHF让它可以扮演有用的助手。没有工具调用、没有搜索、也没有推理能力。

    初代 ChatGPT 被禁锢在训练数据和用户输入的 prompt 内,能力仅此而已。它就是缸中之脑。

    Agent Harness 就是让大语言模型挣脱这层禁锢、与真实数字信息空间产生交互的一套机制。

    Harness 到底是什么

    定义:Agent Harness 是除模型权重之外,让 Agent 可以正常运转的全部组件。包括模型周边的运行环境、工具、上下文以及防护约束。失去 Harness,模型就只是缸中之脑。它可以产生判断,但必须依靠 Harness才能把判断落实到真实数字空间中执行。

    Harness 相当于给模型的思维赋予一具躯体。依托 Harness,模型可以感知信息(上下文)、执行动作(工具)、持久留存信息(记忆与信息压缩),并执行自身的行为边界约束(权限与防护规则)。

    Harness 1.0:过去,外挂拼装时代

    模型与 harness 的演进过程可以用两条曲线描述:Harness 对模型提出的能力要求,以及模型实际能输出的能力。

    两条曲线之间的差值,就对应 Agent 的实际效果;而两条曲线差距不断收窄,正是Lukasz Kaiser 所提到 Agent 出现肉眼可见进步的根源。

    下面分阶段讲述这个差距是如何逐步缩小的:

  • ReAct:纸上的 Harness(2022 年 10 月):ReAct 是一套提示词技术,通过提示词引导模型完成推理。它只是写在方案里的 agent 循环逻辑,完全独立于模型权重之外。它定义了 “Agent Loop”概念:模型推理‑> 执行动作‑> 观察结果‑> 循环往复。重申:ReAct 循环仅仅是一种提示词方案。彼时提示词是唯一的推理实现手段,当时还没有人把它叫做 Harness。同年冬天 Meta 发布的 Toolformer(2023 年 2 月)预示:工具调用能力可以通过训练内置到模型,而不是靠提示词去诱导。这有点像阿兰・图灵提出计算机构想,但还没有实体硬件落地的阶段 —— 强大的构想,等待后续才得以实现。(ReAct 比 ChatGPT 早一个月,2022 年 10 月对比 11 月)。这个阶段两条曲线数值都接近 0,因为行业刚刚起步,二者差距并不大。
  • AutoGPT/BabyAGI:过早的自主能力(2023 年春):AutoGPT、BabyAGI 时期,Harness 的能力需求曲线大幅跑赢模型能力曲线。二者都把完全自主的权限交给模型,希望模型充当 “自主工作的员工”,但当时的模型还只是脆弱的下一 token 预测器。循环本身不会给模型增加新能力。循环只会放大模型本身已有的能力;当模型能力低于某个阈值,循环只会放大错误,而不是提升可靠性。可以看负面的复利效应:单步可靠性 95%,执行 20 步的任务,整体平均成功率仅约 36%。Harness 交给模型一个它根本没有能力完成的任务。这就是两条曲线差距拉到最大的时期。之后 18 个月行业都在想办法弥合这个鸿沟。
  • Cursor/Copilot:回归HITL(2023‑2024):第一批 AI 驱动的Coding IDE厂商意识到,把过多自主权限交给模型会带来大量失效问题。于是它们压低 Harness 需求曲线,使之低于模型能力曲线,以此缩小差距。不直接把循环交给模型,而是把循环交还给人,由人来统筹调度整个循环,模型只负责帮人提升效率。初代 Devin 尝试重新把自主能力交还模型,但 Answer.AI 团队的测试显示此举依旧为时过早,任务成功率仅约 15%。这证明 IDE 厂商放弃完全自主并不是保守怯懦,而是正确选择。不过,虽然主流策略是压低 Harness 的预期,模型本身还在持续变强。2024 年末,首个推理模型 o1 问世,两条曲线的差距发生反转,我们首次观察到模型能力过剩的苗头。
  • Claude Code:两条曲线交汇(2025 年 2 月):2024 年末出现的反转创造出一个等待被抓住的机会:当模型能力已经超过 Harness 的上限,如果 Harness 还刻意限制模型发挥,就会白白浪费模型潜力。Claude Code 是第一款抓住这个机遇的代码 Agent。它放弃 IDE 环境,直接使用终端,向模型开放 bash 命令与文件读写权限,用权限规则替代每一步操作都需要人工审批的模式。循环逻辑再次交还模型,而这一次模型足以胜任任务。Boris Cherny 及其团队在开发 Claude Code 时,瞄准的是下一代模型的能力,而非当下的模型。它大获成功,不是因为它第一个赋予模型自主权限,而是它是第一个选对时机 的产品。这个时机就是模型可靠性已经足够支撑自主运行的交汇节点。短短六个月 Claude Code 的 ARR(年度经常性收入)就接近 10 亿美元,根源就在于 Anthropic 抓住了两条曲线交汇带来的机遇。
  • 接下来两条曲线不再仅仅交汇,而是开始交织缠绕在一起。

    Harness 2.0:当下,联合训练时代

    如今 Harness 的重要性已经可以量化验证。Harness‑Bench 基准测试,使用同一个模型,在不同 Harness 下运行 106 项相同任务,最终得分区间 52.4‑76.2 分。模型本身没有任何改动,分数差距却高达 23.8。Agent 的能力有一半来自 Harness。

    OpenAI 也通过修改 Harness,在 ARC‑AGI‑3 基准上拿到类似结果。仅增加retained reasoning与信息压缩能力后,GPT‑5.6 Sol 在 ARC‑AGI‑3 上的得分直接翻三倍,从 13.3% 提升至 38.3%。

    底层发生的变化是强化学习RL已嵌入到 Harness内部。OpenAI 在 2025 年 5 月 codex‑1 发布公告中写道:

    “codex‑1 针对不同环境下真实世界编码任务做强化学习训练。”

    两条曲线合二为一,交织成一套统一系统。

    Toolformer 当年的构想终于落地成真。工具调用不再靠提示词诱导,而是模型训练出的能力。

    当模型在 Harness 环境中完成训练,就会把 Harness 的能力吸收进自身权重,例如模型会结合自身上下文窗口特性,学会自动做信息压缩。

    GPT‑5.1‑Codex‑Max 发布说明写道:

    GPT‑5.1‑Codex‑Max 是“首款经过原生训练,可以靠信息压缩跨多上下文窗口运行的模型。”

    一旦模型吸收了 Harness 的能力,Harness 就可以剥离对应的脚手架代码。这是一种做减法的工程生产方式。Anthropic 的 Thariq Shihipar 提到,团队最近删掉了 Claude Code 里 80% 的系统提示词。

    衡量 Agent Harness 演进速度的标尺,就是在维持同等能力前提下,可以删掉多少 Harness 的原有逻辑。这正是 AI 工程师应当奔赴的工程方向。

    于是模型与 Harness 的演进循环就是:训练‑>吸收‑>剥离脚手架‑>循环往复。模型不断去攻克下一个自己尚且做不到的任务。

    Kaiser 提到的那次能力跃升之所以难以溯源,是因为它并不是一个独立离散事件。预训练带来的提升很容易感知,可以直接写进模型卡片;但模型‑Harness 协同演进带来的提升却很难追踪,因为这个演进过程没有文档记录。这就是去年冬天那次跃升的谜底:提升来自模型与 Harness 协同工作的交互地带。

    值得考虑的是:如果 Harness 的每一项能力最终都会被模型吸收,那最后还会剩下什么?

    Harness3.0:未来,注意力时代

    持续删除所有可以被模型吸收的逻辑。想象走完这个全过程之后 Agent 会是什么样子。当你删完所有可被吸收的部分,手里还会剩下什么?

    模型权重接下来还会吸收哪些能力?多 Agent 编排、工具选择、记忆机制,这些都有可能。很多研究人员正在开发可以自我迭代优化的 Harness,它们本身也可以像模型一样接受训练。

    经过这一轮删除与吸收,最终留存下来的是以人类为核心的 Agent 能力:例如权限、身份、信任、可解释性。倘若权限逻辑被模型完全内化吸收,权限本身的概念就会消解。能力吸收并不会消灭 Harness,只会把 Harness 的角色彻底反转。

    Harness 会转变为 Agent 和操作人间的交互接口

    Harness 诞生之初,是人类对接模型的接口。交互形态从聊天框,演进到 IDE,再到终端。当模型把面向计算机的能力全部内化之后,演进就会上一个抽象层级。Harness 会变成模型对接人类注意力的接口。

    它演变为注意力接口(attention‑interface)

    Ryan Lopopolo 在 Latent Space《面向百亿 token 规模系统的极致 Harness 工程》播客节目中谈到:

    “真正本质稀缺的资源,是团队成员同步的人类注意力。”

    Token 已经变得充足且稳定,但是稀缺的人类注意力依旧是系统瓶颈。

    我们已经可以看到该方向的雏形,比如 Anthropic 的 Agent 长期任务进度文件、Agent 审批队列。

    当模型吸收 Harness 能力之后,模型与Harness 间的差距并不会消失。原先的差距转移到“人”这一侧,由此产生一套新的曲线关系,也出现了新的曲线gap。这个gap就是 Agent 对人类提出的需求,和人类实际能够输出的反馈间的落差。

    注意力接口

    我预测一年之内,所有做 Agent AI 的公司都会推出一套人类注意力策略配置界面,就像如今各家 Agent 厂商都会提供 AGENTS.md 文件一样。

    AGENTS.md 用来告诉 Agent 如何和你的代码库交互。而注意力接口会告诉 Agent 如何与你协作。它管控 Agent 什么时候可以打断你、什么时候应当静默继续后台运行、哪些决策可以自行完成,哪些决策必须等待你的审批。就像 Agent 系统里其他组件一样,这套接口也会成为可学习组件,依靠数据持续迭代优化。人类每一次纠正,都会转化为有效训练数据。

    总结:模型始于缸中之脑。Harness 给这颗大脑赋予躯体,而后躯体又逐步消融,融入大脑本身。留给我们去构建的,是未来任何模型都无法内化吸收的东西:唯一真正稀缺资源 ——人类注意力 的接口。

    赞(0)
    未经允许不得转载:171主机测评 » Agent Harness的演进过程
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址