引子:这篇文章和市面上的有什么不同
Cloud Native
DeepSeek 开源的 Agent Harness(DSH)已经有不少介绍文章了:它是什么、怎么装、插件架构有多优雅。这些文章大多止步于“又一个 Agent 框架”,因为它们回答的问题是“DSH 长什么样”。
这篇文章想回答另一个问题:为什么一家模型厂商要花这么大精力做一个 Harness,以及它的设计选择对企业意味着什么。
切入点是后训练。后训练(SFT、RLHF、agentic RL)做的事是:在权重里塑形模型行为。而 Harness 做的事是:在环境里塑形模型行为——通过工具集、护栏、审批、反馈,改变模型实际表现出来的策略。这两条路指向同一个目标:让模型按你需要的方式干活。区别只是生效时延、可撤销性和爆炸半径。
一旦用后训练这个视角看 Harness,DSH 的很多设计决策就串成了一条线:那些看起来像工程师洁癖的设计和抽象——日志即状态、一切皆派生、能力即插件——连起来看,遵循的是敏捷试验、谨慎固化,铺出的是一条完整的企业进化路径:环境塑形、轨迹沉淀、权重塑形。本文希望把这条线讲清楚,并用自进化 POC 验证它到底通不通,又在哪里断裂——接口设计、契约形态、反馈质量。
01 先把三层概念说清:预训练、后训练、工作现场
Cloud Native
一个模型进入企业的完整链条是三层:
第一层,预训练。模型出厂时的




