欢迎光临
我们一直在努力

模型后训练视角:DeepSeek Harness 把企业进化做进了架构

引子:这篇文章和市面上的有什么不同

Cloud Native

DeepSeek 开源的 Agent Harness(DSH)已经有不少介绍文章了:它是什么、怎么装、插件架构有多优雅。这些文章大多止步于“又一个 Agent 框架”,因为它们回答的问题是“DSH 长什么样”。

这篇文章想回答另一个问题:为什么一家模型厂商要花这么大精力做一个 Harness,以及它的设计选择对企业意味着什么。

切入点是后训练。后训练(SFT、RLHF、agentic RL)做的事是:在权重里塑形模型行为。而 Harness 做的事是:在环境里塑形模型行为——通过工具集、护栏、审批、反馈,改变模型实际表现出来的策略。这两条路指向同一个目标:让模型按你需要的方式干活。区别只是生效时延、可撤销性和爆炸半径。

一旦用后训练这个视角看 Harness,DSH 的很多设计决策就串成了一条线:那些看起来像工程师洁癖的设计和抽象——日志即状态、一切皆派生、能力即插件——连起来看,遵循的是敏捷试验、谨慎固化,铺出的是一条完整的企业进化路径:环境塑形、轨迹沉淀、权重塑形。本文希望把这条线讲清楚,并用自进化 POC 验证它到底通不通,又在哪里断裂——接口设计、契约形态、反馈质量。


01 先把三层概念说清:预训练、后训练、工作现场

Cloud Native

一个模型进入企业的完整链条是三层:

第一层,预训练。模型出厂时的

赞(0)
未经允许不得转载:171主机测评 » 模型后训练视角:DeepSeek Harness 把企业进化做进了架构
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址