学生模型更小,推理价格也更低,项目账单却没有随之下降,这种情况完全可能发生。原因通常藏在一次业务任务的完整路径里。模型先读输入,再生成结果,随后经过格式解析、事实校验、工具执行、失败重试和人工复核。任何一环变差,低廉的单次推理都有可能被更多调用和返工抵消。
知识蒸馏最初就带有部署动机。Hinton、Vinyals 和 Dean 在论文中讨论了把复杂模型或模型集成的知识迁移到更容易部署的小模型。但“更容易部署”依然需要在具体工作负载上验证。模型文件变小、每 Token 价格下降,无法自动推出端到端服务更省钱。
先把计价单位从Token换成合格任务
如果业务是提取合同字段,一次任务的结果应当是字段正确、格式可读并且风险项没有遗漏。如果业务是客服回答,结果还要满足知识依据、语气规范和升级规则。Token 是供应方常用的计费维度,企业内部更适合观察每个合格任务的成本。
可以采用一个建议口径。某段时间的完整任务成本,包含模型调用、检索、工具、计算资源、重试、人工复核与错误处置费用,再除以最终合格的任务数。这个口径不属于会计标准,也不适合跨公司直接比较。它的价值在于让同一个团队比较教师方案、学生方案和混合路由方案。
假设教师一次就能完成多数任务,学生平均要调用两次,还需要额外的校验模型。即使学生每次便宜很多,调用次数增加以后,差距会迅速缩小。若失败任务还要转给教师,企业实际购买的是“学生尝试加教师回退”,账不能只记第一次尝试。
低价最容易被四类损耗吃掉
第一类损耗来自输出变长。较小模型可能需要更长的系统提示、更多示例或反复追问,才能保持格式稳定。输入和输出量一起增加,名义单价优势会被稀释。比较时要固定任务集合,并记录真实的输入输出分布,不能只拿厂商页面上的单价做乘法。
第二类损耗来自失败重试。超时、限流、解析失败和答案不合格的含义不同。服务错误可能适合退避重试,内容不合格则需要换提示、换模型或转人工。把所有失败都机械重试,只会增加调用量。每次尝试应保存原因和最终去向,是否计费则根据调用记录和结算结果核对。
第三类损耗是质量返工。学生回答大体正确,却在关键实体、数字或工具参数上出错,后续系统可能无法直接发现。人工复核时间、工单重新打开次数和错误处置都是真实成本。高风险任务还会带来远高于调用费的业务损失,所以这类任务不能用平均正确率掩盖。
第四类损耗来自基础设施。自部署学生模型要占用计算、存储和运维资源。云端或本地 GPU 的成本还受并发、输入输出长度、利用率、批处理和延迟目标影响。低负载时,空闲资源会抬高单位任务成本。高负载时,排队又可能迫使团队增加实例。公开推理架构也强调应同时测量首 Token 延迟、输出速度、吞吐、并发和错误率,单个峰值指标无法代表生产表现。
质量下降会怎样传到系统后面
学生模型的错误很少停在模型这一层。结构化输出少一个字段,解析器可能直接拒绝。工具名称选错,执行器会返回异常。检索答案遗漏依据,人工审核就要重新查材料。若业务流程允许自动写入数据库,一个小错误还可能进入下游,需要回滚和补数据。
因此,评测集要覆盖完整任务。离线阶段可以保留准确率、格式通过率和安全指标,上线前还要回放真实流量,观察任务成功率、升级率、平均调用次数和人工介入时间。教师与学生使用同一批输入、相同工具和相同验收规则,比较才有意义。
严重错误应单独计数。学生在大量简单题上得分很高,不能抵消少量权限越界或关键数字错误。企业可以为不同风险类别设置不同门槛。低风险文案允许人工抽检,高风险操作要求教师复核或直接走更强模型。模型路由往往比“全部换成学生”更容易控制成本。
用路由和回退保住节省空间
一种实用做法是先让规则或轻量分类器判断任务难度。稳定、重复、低风险的请求交给学生。长上下文、复杂推理和高风险请求直接交给教师。学生输出若未通过格式或置信规则,再升级处理。路由器也会判断错误,所以要记录每次选择、升级原因和最终结果。
成本核算要把整个调用链串起来。任务编号贯穿学生请求、校验、教师回退和人工处理。团队随后才能知道,哪一类任务真正从蒸馏获益,哪一类任务始终依赖教师。若只汇总两个模型各自的 Token,路由带来的重复成本就会失去上下文。
多模型试验期间,147AI可以作为统一接入的候选平台。团队可用不同 API Key 区分实验或业务场景,并结合调用量、消耗和日志做核对。平台记录可以帮助整理模型调用,端到端任务编号、验收结果和人工时间仍需在企业自己的系统中关联。具体模型和计费方式以当前页面为准。
什么时候可以确认蒸馏真的省钱
至少跑完两个阶段。离线对照先验证学生在独立测试集上的质量,并找出严重错误。小流量试运行再测完整任务成本、延迟分位数、并发和回退比例。测试集不能反复参与调参,真实流量也应先去除敏感信息并遵守数据边界。
当学生在目标任务上达到质量门槛,单位合格任务成本持续低于教师方案,回退和人工负担没有反弹,运维资源也能稳定承受,团队才有理由扩大流量。若只有每 Token 价格更低,其余指标没有改善,项目仍处于待验证状态。
蒸馏的收益不会写在模型名称里。它要落到一次任务少花多少钱、少等多久、少占多少资源,同时没有增加不可接受的错误。把这几项放进同一张账,低价学生究竟有没有创造收益,答案才会清楚。
参考资料
- 知识蒸馏原始论文
- 英伟达推理参考架构
- 147AI公开状态页面



