AI Agent 的成功秘诀:Harness 才是产品,模型只是引擎
最近刷到一条特别扎心的新闻:Gartner 预测,到 2027 年会有超过 40% 的 Agentic AI 项目直接被砍掉。七份独立研究也反复印证——复杂企业任务上,Agent 的失败率高达 70-95%。大家第一反应都是“模型不够强”,但 LangChain 用一个真实案例狠狠打了脸:
他们的编码 Agent 在 Terminal Bench 2.0 上的得分,从 52.8% 直接干到 66.5%,排名从 Top 30 冲进 Top 5。零参数改动,零模型升级,只改了一个东西——Harness(代理的外壳系统)。
这让我瞬间清醒:模型从来不是瓶颈,真正的护城河,是你给模型套上的那套“马具”。
Harness 到底是什么?
简单说,Harness 就是包裹在模型外面的全套基础设施。它不是模型本身,也不是你写的那堆 Prompt,而是决定模型“怎么看世界、怎么做事、怎么记住教训”的控制系统。
OpenAI 内部有个百万行代码的生产应用,一行代码都不是人手写的。工程师真正干的活,是设计 Harness:约束条件、反馈闭环、文档规范、Lint 规则、生命周期管理……让模型能稳定地写出可靠代码。
Harness 就干三件事:
- 上下文架构:每一步让模型只看到该看的信息
- 执行护栏:告诉它什么能干、什么绝对不能碰
- 记忆基础设施:让它真正记住自己的历史,而不是每次都失忆
没有 Harness,模型再聪明也只是“单次推理高手”;有了 Harness,它就变成了能持续进化的生产力系统。
为什么“巨型指令文件”注定失败?
很多团队的第一个反应是:给 Claude 塞一个 2000 行的 CLAUDE.md,把所有边缘 case 都写进去。结果呢?模型直接选择性失明,一半规则直接忽略。
因为上下文是稀缺资源。当所有东西都标“重要”的时候,就什么都不重要了。
OpenAI Codex 团队的做法特别值得学:把根指令文件当成“目录”,真正的内容放在结构化的 docs/ 目录里。模型只在需要的时候动态拉取对应文档,而不是每次都把整本百科全书塞进去。
核心模式就四条:
Harness 工程的四大支柱
真正能上生产的系统,必须同时具备这四根支柱。缺一根,Agent 就会漂移;四根齐全,Agent 就会复利增长。
支柱一:分层上下文架构
采用“渐进式披露”:先给项目级全景,再给模块级细节,最后才到文件级历史。永远不一次性塞满上下文窗口。
支柱二:Agent 专业化
别再用一个“全能 Agent”了。生产环境要拆成多个专职 Agent:写代码的、写测试的、做 Review 的、负责部署的。每个只给它需要的工具,互不干扰,通过结构化交接沟通。
支柱三:持久化记忆
对话历史关掉窗口就没了,那不叫记忆。真正的记忆要落在文件系统里:
- decisions.md(架构决策 + 理由 + 日期)
- failure-catalog.md(失败模式索引 + 解决模板)
- session-state.md(本次改了什么、测试挂了什么、学到了什么)
Agent 每次启动先读记忆,结束前再写记忆,形成审计闭环。
支柱四:结构化执行流程
绝不能让模型“一 Prompt 直出代码”。必须强制走:研究 → 规划 → 执行 → 验证 的完整流程,每一步都有 Review 和 Guardrail。
护栏分层设计(最容易被忽略的金矿)
我见过太多团队把护栏当成“可商量”的建议,这是大忌。真正的生产护栏必须是硬策略,模型无权绕过。
推荐的护栏目录结构:
- 硬限制层(成本上限、时长上限、文件修改上限、工具白名单)
- 安全网层(部署前必须模拟、测试不通过不提交、人审关键路径、自动回滚)
- 黄金路径层(语言级代码模式、架构边界约束、命名规范强制)
- 审计层(每一步操作日志、累计花费追踪、决策轨迹)
Harness 的复利效应
没有 Harness 的 Agent,每次启动都是从零开始:重新发现模式、重复踩坑、零机构记忆。
有了 Harness 之后,每一次失败都变成 failure-catalog.md 里的新条目,每一次决策都带着 rationale 被记录下来,半年后你的系统就拥有了任何新模型都无法复制的机构记忆。
LangChain 这次冲榜的本质就是:模型没变,Harness 积累的上下文让模型的活儿越来越好干。
生产落地检查清单
想立刻开始优化自己的 Agent?直接对照这张清单:
- 根指令文件 < 200 行
- 知识按主题结构化存放 + 动态注入
- 上下文分层 + Token 预算告警
- 拆分专业 Agent + 工具域限定
- 持久化记忆文件(decisions/failure/session)
- 强制研究-规划-执行-验证流程
- 硬限制(成本/时长/文件数)
- 部署前模拟 + 测试门 + 自动回滚
- 全量操作审计日志
写在最后
模型层正在快速商品化。GPT-5、Claude Opus、Gemini 2.5……每一次发布,能力差距都在缩小。卡内基梅隆大学的研究也证实:Agent 在标准办公任务上成功率只有 24%,问题从来不在“智能”,而在“基础设施”。
赢家从来不是买到最好模型的团队,而是把 Harness 建得最扎实的团队。
Harness 才是产品。
模型只是引擎。
没人会因为引擎好就买一辆车。
你的 Agent 项目里,最缺的那道护栏是什么?欢迎评论区交流你正在用的 Harness 设计,我很想看看大家都在怎么“给模型上马具”。
我是紫微AI,我们下期见。





