目录
一、事件复盘:一次低调更新,为什么产生了高强度外溢
二、技术面分析说明
(一)技术面一:为什么能在不扩模型的情况下大幅提升 Agent
后训练不是简单“多喂一点数据”
(二)技术面二:V4 的底层创新到底是什么
1. CSA/HCA:百万 Token 上下文的主架构
2. mHC:让更深、更复杂的残差连接保持可训练
3. DeepSeekMoE、MTP 与 FP4:把容量、计算和吞吐拆开
4. Muon:训练优化器进入模型竞争主战场
5. 两个必须纠正的技术误读
(三)技术面三:13B 激活参数不等于 13B 本地模型
三、整个行情面分析
(一)行情面一:“AI 斩杀线”不是性能第一,而是默认入口之争
行情演化的三个机制
(二)行情面二:价格优势有多大,应该怎样计算
企业真正应该计算的公式
(三)行情面三:流量爆发说明了什么,又不能说明什么
流量信号仍然具有三层价值
四、商业落地:哪些场景值得优先迁移,哪些场景应保留旗舰模型
五、风险边界:低价与高跑分之外,还要看六个问题
六、未来 3—6 个月:三种情景与六个观察指标
基准情景:Flash 成为默认执行层,旗舰负责升级
乐观情景:V4-Pro 正式版与 Harness 形成生态闭环
风险情景:容量、真实可靠性或安全事件削弱扩张
建议持续跟踪的六个指标
七、结论:DeepSeek 改写的是模型选型函数,而不是终结参数规模
参考资料
干货分享,感谢您的阅读!
在大模型行业,过去大家比的是谁参数更多、GPU 更多、发布会更大,仿佛模型不做到“万亿参数”,都不好意思坐上主桌。但 DeepSeek 这次偏偏没按剧本来。
7 月 31 日,没有铺天盖地的发布会,只是安静地更新了一版 V4-Flash-0731。结果几天之内,代码能力、Agent 表现、推理成本和开发者调用量一起冲上讨论区,“AI 斩杀线”也迅速成了行业热词。
真正值得关注的,并不是又多了一个跑分更高的模型,而是一个更现实的问题:当一个模型已经足够强,同时便宜到让人开始重新计算成本时,大模型竞争的规则是不是已经变了?

本次我们就从技术面、成本面、生态面和市场行情四条线,把 DeepSeek V4-Flash 背后的逻辑拆开来看。
-
V4-Flash-0731 的核心事实不是“换了一个更大的模型”,而是与预览版保持相同架构和参数规模,仅通过再次后训练,让代码 Agent、终端操作和工具调用能力出现跃迁。官方模型卡显示,DeepSWE 从 7.3 升至 54.4,Terminal Bench 2.1 从 61.8 升至 82.7。[1][2]
-
这次更新的意义也不是“全面击败旗舰模型”。它证明的是:在特定 Agent 工作负载上,后训练、评测 Harness、推理强度和工具编排,可以比单纯增加总参数更快地改善可用性;知识密集型与极复杂任务仍可能需要更大的 V4-Pro 或闭源旗舰模型。[2][3]
-
“AI 斩杀线”更适合被定义为能力—成本的帕累托边界:当一个模型达到足够高的任务完成率,同时把边际成本压低一个数量级,性能较弱且价格更高的模型会失去默认入口,而不是所有高端模型都会被淘汰。
-
原始材料中的三处说法需要校正:Engram 并非 V4 已部署核心组件,而是论文列出的未来方向;V4 的注意力主线是 CSA/HCA,而不是把 MLA 继续作为主要卖点;0731 不仅有 API,官方权重也已按 MIT 许可开放。[2][3]
-
市场热度是真实的,但数据口径必须拆开:OpenCode 公布的单日 8T Token 中有 5T 来自免费用量;OpenRouter 页面显示的 7.16T 属于 0423 预览版累计量,0731 条目截至本文时点为 3.78T,不能把不同版本、累计量与周榜混为一谈。[6][9]
一、事件复盘:一次低调更新,为什么产生了高强度外溢
2026 年 7 月 31 日,DeepSeek 在 API 更新日志中宣布 V4-Flash 正式版进入公测,模型调用名仍为 deepseek-v4-flash。官方没有举行大型发布会,但同步更新了模型卡和权重,随后开发者社区迅速把讨论焦点集中到 Agent 跑分、价格与开源权重上。[1][2]
这次发布之所以显得“突然”,是因为产品侧变化非常克制:API 后端升级为DeepSeek-V4-Flash-0731,APP 与网页端模型未同步变化,V4-Pro正式版仍处于待发布状态。换句话说,这应该不是一次面向大众用户的产品发布,而是一次直接作用于开发者、Agent 平台和 API 采购方的能力更新。[1]

因果判断要谨慎 OpenAI 对 GPT-5.6 Luna 的 80% 降价公告日期是 7 月 30 日,早于 DeepSeek 0731 更新。两者共同说明价格战在加速,但现有公开时间线不足以支持“DeepSeek 发布后迫使 OpenAI 三周内降价”的直接因果叙事。[10][11]
原始材料中最值得保留与最需要修正的内容:
| 参数不变,只靠后训练实现 Agent 飞跃 | 基本准确。官方明确表示 0731 与预览版架构、规模相同,仅再次后训练。 | 这是本次发布最重要的技术信号。 |
| DeepSWE 7.3→54.4,Terminal Bench 82.7 | 准确,来自官方模型卡;DeepSWE 相对增幅约 645%。 | 提升集中在代码 Agent 与工具任务。 |
| 只开放 API,未开放权重 | 不准确。APP/WEB 未更新,但 Hugging Face 已开放 MIT 权重。 | 应区分产品入口与开放权重。 |
| Engram 是 V4 核心组件 | 不准确。V4 论文把 Engram 写入未来探索方向。 | 不能把研究路线图写成已上线能力。 |
| V4 延续 MLA 作为注意力核心 | 表述不准确。V4 论文明确以 CSA/HCA 混合注意力为主线。 | V3/R1 技术谱系可以提,但应突出 V4 新架构。 |
| OpenAI 降价是 DeepSeek 直接倒逼 | 公开日期不支持直接因果。 | 可写“同周期价格竞争加速”,不宜写成已证实因果。 |
| OpenRouter 7.1T 全部来自 0731 | 不准确。官方页面的 7.16T 对应 0423 预览版累计量。 | 版本、时间窗和免费流量必须拆分。 |
二、技术面分析说明
(一)技术面一:为什么能在不扩模型的情况下大幅提升 Agent
官方模型卡给出的对比非常鲜明:DeepSWE 从 7.3 提升到 54.4,Terminal Bench 2.1 从 61.8 提升到 82.7,AutomationBench Public 从 10.8 提升到 25.1,DSBench-Hard 从 25.8 提升到 59.6。更引人注目的是,0731 在这组 Agent 基准上普遍超过 V4-Pro 预览版。[2]

这组结果说明,大模型能力并不是由总参数唯一决定。Agent 任务需要模型在长轨迹中持续完成四件事:理解状态、选择工具、执行动作、根据反馈修正计划。任何一个环节的失败都会让最终成功率归零。针对工具轨迹、代码仓库修改、终端操作和错误恢复做专项后训练,往往可以在不增加参数的前提下显著改善最终任务完成率。
但“反超大模型”的表述必须限定范围。官方 V4 论文指出,Flash 在知识类任务上由于参数规模较小,仍与 Pro 存在明显差距;在更复杂、难度更高的 Agent 任务上,Flash 也可能落后于 Pro。0731 的结论应写成“在官方列出的多项 Agent 基准上超过 V4-Pro 预览版”,而不是“总体能力超过 1.6T 模型”。[3]
后训练不是简单“多喂一点数据”
V4 的公开技术路线是两阶段后训练:先为数学、代码、Agent、指令遵循等领域分别训练专家模型,专家阶段经历高质量 SFT 和基于 GRPO 的强化学习;随后再通过 On-Policy Distillation(在策略蒸馏)把多个领域专家整合进统一模型。与把所有任务直接塞进一次混合 RL 相比,这种方式更容易减少任务冲突,并让不同领域的奖励函数保持清晰。[3]
0731 又在这个 V4 底座上做了再次后训练。官方尚未披露完整数据配方,因此外界可以合理判断其重点覆盖代码 Agent、工具调用、多步执行和指令遵循,但不应把所有提升都归因于某一个单独算法。真正有效的系统通常是数据、奖励、采样、工具协议、上下文管理和 Harness 联合优化的结果。
评测 Harness 也是模型能力的一部分 官方说明,代码 Agent 公共基准使用待开源的 DeepSeek Harness 极简模式,并采用 max 推理强度、temperature=1.0、top_p=0.95。Agent 跑分不是“裸模型静态考试”,框架的工具定义、上下文压缩、错误恢复和最大步数都会影响结果。[1][2]
(二)技术面二:V4 的底层创新到底是什么

1. CSA/HCA:百万 Token 上下文的主架构
V4 的注意力主线是 Compressed Sparse Attention(CSA)与 Heavily Compressed Attention(HCA)的混合设计。CSA 先沿序列维度压缩 KV,再执行稀疏注意力;HCA 采用更强压缩,但保留稠密注意力。官方论文称,在 1M 上下文场景中,V4-Flash 的单 Token 推理 FLOPs 约为 V3.2 的 10%,累计 KV Cache 约为 V3.2 的 7%。这才是 V4 能把长上下文真正用于 Agent 长任务的底层条件。[3]
2. mHC:让更深、更复杂的残差连接保持可训练
Manifold-Constrained Hyper-Connections(mHC)通过对多通路残差连接施加流形约束,提升模型表达能力和训练稳定性。它并非“免费增益”:mHC 会增加激活内存和通信,因此 V4 同时设计了融合内核与选择性重计算来控制成本。[3]
3. DeepSeekMoE、MTP 与 FP4:把容量、计算和吞吐拆开
V4 延续 DeepSeekMoE 和 Multi-Token Prediction(MTP)。MoE 让模型拥有 284B 总参数,但每个 Token 只激活约 13B 参数;MTP 则继续服务于训练效率和推理加速。V4 还对路由专家权重和部分索引路径进行 FP4 量化感知训练,并在模型卡中提供 DSpark 投机解码配置,使服务吞吐与延迟成为架构设计的一部分。[2][3]
4. Muon:训练优化器进入模型竞争主战场
V4 大部分模块采用 Muon 优化器,嵌入、预测头、部分归一化与 mHC 参数仍使用 AdamW。Muon 的价值不只是“收敛更快”,而是配合混合 Newton-Schulz 迭代、ZeRO 分桶和低精度通信,实现大规模 MoE 训练的稳定性与工程效率。[3]
5. 两个必须纠正的技术误读
-
Engram:官方 V4 论文把它作为未来可探索的“稀疏嵌入/条件记忆”方向,并未将其列入当前 V4 主体架构。[3]
-
MLA:MLA 是 V2/V3/R1 的重要技术资产,但 V4 论文明确把 CSA/HCA 作为长上下文注意力主线。文章可以讨论技术继承,却不应把 MLA 写成 V4 的核心新卖点。
(三)技术面三:13B 激活参数不等于 13B 本地模型
“激活 13B”最容易被营销化误读。它表示一次前向计算中只调用少量专家,因此主要降低每 Token 的计算量;但完整的专家权重仍然属于模型,需要存储、加载和跨设备路由。按 284B 参数粗略估算,FP8 权重下限约 284GB,4-bit 权重下限也约 142GB,尚未计入投机模块、KV Cache、运行时内存和并行开销。

官方模型卡给出的 vLLM 示例是单个 4×GB300 节点,这已经说明所谓“本地部署”更接近企业机房、多卡服务器或云端专属实例,而不是普通消费级单卡。开放权重的商业价值依然很高:企业可以做私有化部署、领域微调、审计和供应商替换;但不能把开放权重等同于低门槛运行。[2]
开放权重真正改变的是议价权 即使企业最终仍使用托管 API,MIT 权重也能降低供应商锁定风险:可以做离线评测、建立自有推理服务、训练领域适配器,并在价格或合规条件变化时保留迁移路径。
三、整个行情面分析
(一)行情面一:“AI 斩杀线”不是性能第一,而是默认入口之争
“AI 斩杀线”并非标准学术概念,而是开发者社区对能力—成本竞争的形象概括。更准确的定义是:当模型在某类高频任务上达到足够高的成功率,同时把单位成功任务成本压低到竞争对手的几分之一甚至几十分之一,它会成为默认调用层,并迫使其他模型选择降价、提升能力或转向更高价值的细分市场。

这条线不是固定价格,也不是某个综合跑分。它会随任务而变化:代码修复、批量工具调用、文档处理等可验证任务,更容易形成清晰的成本边界;创意写作、战略判断、复杂研究和高风险决策的质量难以完全量化,高端模型仍有较大溢价空间。
行情演化的三个机制
默认模型迁移:开发者先把高频、低风险、可验证任务迁移到低成本模型,形成调用量和工具生态的正反馈。
旗舰模型上移:高价模型不会立即消失,而是更多承担难题升级、关键步骤复核、长时间自主 Agent 和高风险决策。
路由层成为新入口:企业不再押注单一模型,而是按任务难度、延迟、成本和合规要求动态路由。模型厂商竞争从“谁最强”转向“谁能进入默认路由”。
(二)行情面二:价格优势有多大,应该怎样计算
DeepSeek 官方价格页显示,V4-Flash 每百万 Token 的缓存未命中输入价为 1 元、输出价为 2 元、缓存命中输入价为 0.02 元;同时官方预告将引入高峰时段 2 倍定价。GPT-5.6 Luna 当前官方价为每百万 Token 0.20 美元输入、1.20 美元输出;Claude Opus 4.8 为 5 美元输入、25 美元输出。[4][11][12]

因此,“比 Claude Opus 便宜约 85 倍”可以作为量级描述,但不是唯一口径。按上述示意汇率比较输出价,Opus 4.8 约为 V4-Flash 的 90 倍;若使用 OpenRouter 上 V4-Flash 0731 的 0.18 美元输出价比较,则约为 139 倍。不同渠道、缓存、批量折扣、区域路由和高峰定价都会改变结果。[4][7][12]
企业真正应该计算的公式
单位成功任务成本 C_success =(输入 Token 成本 + 输出/思考 Token 成本 + 工具调用成本 + 重试成本 + 推理基础设施 + 人工复核)÷ 最终成功率
低单价只有在成功率、延迟与稳定性达到业务阈值时才会转化为真实优势。一个模型若便宜 20 倍,但需要 8 次重试、输出冗长、工具误调用频繁,最终优势可能被消耗掉;反过来,在批量生成、代码扫描、测试修复和数据清洗中,即使成功率略低,只要任务可自动验证,低价模型仍可能拥有极强经济性。
(三)行情面三:流量爆发说明了什么,又不能说明什么
OpenCode 公布,2026 年 8 月 1 日 DeepSeek Flash 在其平台处理 8T Token,其中 5T 来自免费用量、3T 来自 OpenCode Go。这个数字证明低价模型可以释放此前被配额压抑的开发需求,但免费流量占比很高,不能直接按官方单价换算收入,也不能等同于独立付费客户数。[9]
OpenRouter 的官方 DeepSeek 页面在本文时点显示:V4 Flash 0423 条目累计 7.16T Token,V4 Flash 0731 条目累计 3.78T,V4 Pro 累计 3.07T。这里的关键是“不同模型条目 + 累计量”,不能把 7.16T 全部归属于 0731,更不能与 OpenCode 的单日数据直接相加。[6]

流量信号仍然具有三层价值
-
产品层:大量开发者愿意把真实代码任务交给 V4-Flash,说明其体验已跨过“可尝试”门槛。
-
生态层:OpenAI/Anthropic 兼容 API、Responses API、Codex 适配和开源权重共同降低迁移成本。[1][5]
-
商业层:当 Token 变得足够便宜,Agent 产品可以从“按次节省”转向“默认常开”,催生更长轨迹、更高频自动化与更大胆的免费层。
同时,Token 爆发也可能代表模型更爱输出、更长思考、更多工具往返,未必等同于生产率同比例增长。行业下一阶段需要关注“每个成功任务的 Token”“人类接管率”“代码回滚率”和“真实付费留存”,而不是只看总 Token。
四、商业落地:哪些场景值得优先迁移,哪些场景应保留旗舰模型
V4-Flash-0731 最适合的不是所有任务,而是高频、工具化、可验证、成本敏感的工作负载。企业可将其定位为默认执行层,再为高难任务配置升级模型或人工复核。
| 场景 | 建议等级 | 理由 | 关键控制点 |
| 代码修复 / 测试生成 / 仓库问答 | 优先试点 | 官方 Agent 基准提升显著,低成本适合多轮迭代。 | 必须在沙箱运行,强制测试、Diff 审核与回滚。 |
| 批量数据清洗 / 结构化抽取 | 优先试点 | 任务可校验、并发高,价格优势容易转化为 TCO。 | 使用 JSON Schema、抽样复核和失败重试上限。 |
| 长文档分析 / 大代码库检索 | 适合评测 | 1M 上下文与压缩注意力有优势。 | 验证真实长上下文召回,不把窗口长度等同于有效记忆。 |
| 企业内部 Agent / 工具编排 | 适合评测 | Responses API 与工具调用降低接入成本。 | 最小权限、工具白名单、状态机和预算上限。 |
| 高风险决策 / 法律医疗财务 | 谨慎使用 | 低成本不能替代责任与可靠性。 | 限定为辅助分析,保留专家复核和可追溯证据。 |
| 创意、品牌、复杂战略判断 | 双模型对照 | Flash 的优势主要集中在可验证任务。 | 与旗舰模型盲测,按业务偏好而非单一跑分选择。 |
| 图像/文件原生多模态 | 暂不优先 | 当前 DeepSeek Responses API 不支持图片和文件输入。 | 使用外部 OCR/解析层或选择原生多模态模型。[5] |
| 私有化部署 | 大型组织可评估 | MIT 权重支持审计、微调和供应链控制。 | 完整权重体量大,需要多卡推理、运维与安全团队。 |
推荐的企业模型路由架构
V4-Flash 作为低成本默认层:处理可验证、可回滚、批量化任务。
旗舰模型作为升级层:当任务复杂度、风险等级或失败次数超过阈值时自动切换。
工具与执行层独立治理:模型只提出动作,权限系统、沙箱、审批和审计决定动作是否执行。
建立自有评测集:至少覆盖成功率、平均 Token、95 分位延迟、重试率、人工接管率和安全违规率。
最有价值的不是“全量替换”,而是“把高价模型从默认层移到升级层” 这通常能在不牺牲关键任务质量的前提下,获得大部分成本收益,并保留供应商冗余。
五、风险边界:低价与高跑分之外,还要看六个问题
Benchmark 与真实业务偏差:官方结果依赖特定 Harness、max 推理强度、温度和工具配置;内部测试集 DSBench 不能由外部独立复现。[1][2]
长轨迹 Token 膨胀:Agent 越自主,思考、工具输出与失败恢复越容易扩大 Token;低价可能刺激过度使用。
容量与定价波动:官方已提示即将采用高峰 2 倍定价,并设置不同模型的并发限制。[4]
工具安全:代码 Agent 拥有终端、文件和网络权限后,提示注入、依赖投毒、凭据泄漏和误删除的风险高于普通聊天。
模型版本混淆:API、APP/WEB、OpenRouter latest、0423 预览版和 0731 正式版可能同时存在,生产系统必须记录实际模型 ID 与评测时间。
私有化运维复杂度:开放权重解决许可和可控性问题,但不自动解决多卡推理、模型并行、监控、补丁、合规和安全响应。
DeepSeek Responses API 当前为无状态接口,多轮对话需要客户端回传完整历史;它支持函数调用和内置 Web Search 类型,但不支持图片、文件输入。企业在迁移 OpenAI Responses API 工作流时,应逐项核对参数兼容性,而不是只替换 base_url 和模型名。[5]
六、未来 3—6 个月:三种情景与六个观察指标
基准情景:Flash 成为默认执行层,旗舰负责升级
最可能的路径是,V4-Flash 在代码、批处理和工具调用场景中快速扩大份额,企业通过路由保留 Opus、GPT-5.6 Sol、V4-Pro 等高端模型。行业定价从“每百万 Token 单价”进一步转向“每个成功任务成本”。
乐观情景:V4-Pro 正式版与 Harness 形成生态闭环
如果 V4-Pro 正式版如期发布,Harness 开源并被主流 Agent 产品采用,DeepSeek 可能同时覆盖低成本默认层和高能力升级层,进一步增强开源生态的议价能力。
风险情景:容量、真实可靠性或安全事件削弱扩张
若高峰价格、并发限制、服务稳定性或真实任务成功率不及预期,企业会把 V4-Flash 保留在批量低风险任务,而不会给予更高权限。代码 Agent 的安全事故也可能迅速改变采购节奏。
建议持续跟踪的六个指标
-
V4-Pro 正式版的发布时间、价格、开放权重与独立评测结果;
-
DeepSeek Harness 是否开源,以及跨框架复现后的 Agent 跑分;
-
OpenRouter / OpenCode 的付费 Token、会话留存和版本迁移,而非仅看总量;
-
高峰定价、并发限制、API 错误率与 95/99 分位延迟;
-
竞争对手的价格、缓存政策、批量折扣与模型路由策略;
-
DeepSeek 是否补齐原生多模态、文件输入和更完整的企业治理能力。
七、结论:DeepSeek 改写的是模型选型函数,而不是终结参数规模
V4-Flash-0731 的行业意义,可以浓缩为一句话:它把接近前沿的代码 Agent 能力压到了极低的边际成本,并证明后训练与系统工程能够让同一底座在短周期内跨越可用性门槛。
这并不意味着参数规模失效。V4-Pro 在知识容量、复杂任务和极限能力上仍有结构性优势;V4 本身也依靠 284B 总参数、32T 预训练 Token、MoE、混合注意力和大规模基础设施。真正被打破的是“只要继续堆总参数就能自动获得商业优势”的简单叙事。
未来竞争会同时发生在五个层面:底座架构效率、后训练范式、Agent Harness、推理服务成本和开发者生态。对企业而言,最理性的策略不是追逐单一榜首,而是建立可测量、可路由、可回滚的多模型系统,把 V4-Flash 这样的低成本模型用于高频执行,把旗舰模型用于关键升级。
最终判断 “AI 斩杀线”不是某个模型把所有对手清场,而是低成本、够用能力与开放生态共同把行业默认值向下重定价。
参考资料
DeepSeek API Change Log
DeepSeek-V4-Flash-0731 official model card
DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
DeepSeek models and pricing
DeepSeek Responses API
OpenRouter DeepSeek model usage page
OpenRouter DeepSeek V4 Flash 0731
OpenCode model usage dashboard
OSChina report quoting OpenCode's 8T-token post
OpenAI: Advancing the price-performance frontier with GPT-5.6
OpenAI API: GPT-5.6 Luna
Claude Platform pricing
Anthropic: Introducing Claude Opus 4.8



