欢迎光临
我们一直在努力

AI Agent 的成功秘诀:Harness 才是产品,模型只是引擎

AI Agent 的成功秘诀:Harness 才是产品,模型只是引擎

最近刷到一条特别扎心的新闻:Gartner 预测,到 2027 年会有超过 40% 的 Agentic AI 项目直接被砍掉。七份独立研究也反复印证——复杂企业任务上,Agent 的失败率高达 70-95%。大家第一反应都是“模型不够强”,但 LangChain 用一个真实案例狠狠打了脸:

他们的编码 Agent 在 Terminal Bench 2.0 上的得分,从 52.8% 直接干到 66.5%,排名从 Top 30 冲进 Top 5。零参数改动,零模型升级,只改了一个东西——Harness(代理的外壳系统)。

这让我瞬间清醒:模型从来不是瓶颈,真正的护城河,是你给模型套上的那套“马具”。

Harness 到底是什么?

简单说,Harness 就是包裹在模型外面的全套基础设施。它不是模型本身,也不是你写的那堆 Prompt,而是决定模型“怎么看世界、怎么做事、怎么记住教训”的控制系统。

OpenAI 内部有个百万行代码的生产应用,一行代码都不是人手写的。工程师真正干的活,是设计 Harness:约束条件、反馈闭环、文档规范、Lint 规则、生命周期管理……让模型能稳定地写出可靠代码。

Harness 就干三件事:

  • 上下文架构:每一步让模型只看到该看的信息
  • 执行护栏:告诉它什么能干、什么绝对不能碰
  • 记忆基础设施:让它真正记住自己的历史,而不是每次都失忆

没有 Harness,模型再聪明也只是“单次推理高手”;有了 Harness,它就变成了能持续进化的生产力系统。

为什么“巨型指令文件”注定失败?

很多团队的第一个反应是:给 Claude 塞一个 2000 行的 CLAUDE.md,把所有边缘 case 都写进去。结果呢?模型直接选择性失明,一半规则直接忽略。

因为上下文是稀缺资源。当所有东西都标“重要”的时候,就什么都不重要了。

OpenAI Codex 团队的做法特别值得学:把根指令文件当成“目录”,真正的内容放在结构化的 docs/ 目录里。模型只在需要的时候动态拉取对应文档,而不是每次都把整本百科全书塞进去。

核心模式就四条:

  • 根指令文件严格控制在 200 行以内
  • 知识按主题拆成结构化目录
  • 动态上下文注入:任务需要什么,就只加载什么
  • 激进剪枝:30 天没阻止过一次失败的规则,直接删!
  • Harness 工程的四大支柱

    真正能上生产的系统,必须同时具备这四根支柱。缺一根,Agent 就会漂移;四根齐全,Agent 就会复利增长。

    支柱一:分层上下文架构
    采用“渐进式披露”:先给项目级全景,再给模块级细节,最后才到文件级历史。永远不一次性塞满上下文窗口。

    支柱二:Agent 专业化
    别再用一个“全能 Agent”了。生产环境要拆成多个专职 Agent:写代码的、写测试的、做 Review 的、负责部署的。每个只给它需要的工具,互不干扰,通过结构化交接沟通。

    支柱三:持久化记忆
    对话历史关掉窗口就没了,那不叫记忆。真正的记忆要落在文件系统里:

    • decisions.md(架构决策 + 理由 + 日期)
    • failure-catalog.md(失败模式索引 + 解决模板)
    • session-state.md(本次改了什么、测试挂了什么、学到了什么)

    Agent 每次启动先读记忆,结束前再写记忆,形成审计闭环。

    支柱四:结构化执行流程
    绝不能让模型“一 Prompt 直出代码”。必须强制走:研究 → 规划 → 执行 → 验证 的完整流程,每一步都有 Review 和 Guardrail。

    护栏分层设计(最容易被忽略的金矿)

    我见过太多团队把护栏当成“可商量”的建议,这是大忌。真正的生产护栏必须是硬策略,模型无权绕过。

    推荐的护栏目录结构:

    • 硬限制层(成本上限、时长上限、文件修改上限、工具白名单)
    • 安全网层(部署前必须模拟、测试不通过不提交、人审关键路径、自动回滚)
    • 黄金路径层(语言级代码模式、架构边界约束、命名规范强制)
    • 审计层(每一步操作日志、累计花费追踪、决策轨迹)

    Harness 的复利效应

    没有 Harness 的 Agent,每次启动都是从零开始:重新发现模式、重复踩坑、零机构记忆。

    有了 Harness 之后,每一次失败都变成 failure-catalog.md 里的新条目,每一次决策都带着 rationale 被记录下来,半年后你的系统就拥有了任何新模型都无法复制的机构记忆。

    LangChain 这次冲榜的本质就是:模型没变,Harness 积累的上下文让模型的活儿越来越好干。

    生产落地检查清单

    想立刻开始优化自己的 Agent?直接对照这张清单:

    • 根指令文件 < 200 行
    • 知识按主题结构化存放 + 动态注入
    • 上下文分层 + Token 预算告警
    • 拆分专业 Agent + 工具域限定
    • 持久化记忆文件(decisions/failure/session)
    • 强制研究-规划-执行-验证流程
    • 硬限制(成本/时长/文件数)
    • 部署前模拟 + 测试门 + 自动回滚
    • 全量操作审计日志

    写在最后

    模型层正在快速商品化。GPT-5、Claude Opus、Gemini 2.5……每一次发布,能力差距都在缩小。卡内基梅隆大学的研究也证实:Agent 在标准办公任务上成功率只有 24%,问题从来不在“智能”,而在“基础设施”。

    赢家从来不是买到最好模型的团队,而是把 Harness 建得最扎实的团队。

    Harness 才是产品。
    模型只是引擎。

    没人会因为引擎好就买一辆车。

    你的 Agent 项目里,最缺的那道护栏是什么?欢迎评论区交流你正在用的 Harness 设计,我很想看看大家都在怎么“给模型上马具”。

    我是紫微AI,我们下期见。

    赞(0)
    未经允许不得转载:171主机测评 » AI Agent 的成功秘诀:Harness 才是产品,模型只是引擎
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址