欢迎光临
我们一直在努力

能力涨6倍,Token烧3倍:V4-Flash正式版的真实账单

7 月 31 日,DeepSeek-V4-Flash 正式版开启公测:9 项 Agent 基准全面反超自家 Pro 预览版,DeepSWE 从 7.3 干到 54.4,涨了约 6.5 倍。

作为专注智算云计费结算的产品经理,我盯着的是另一个数字——Artificial Analysis 测它的时候,它一共生成了 2.1 亿 token,而可比模型的中位数是 6200 万。

能力涨了 6 倍,token 消耗涨了 3 倍。分母和分子,同时在涨。

作为这个系列的开篇,这篇不谈分数谈账单:红利从哪来、硬件怎么选、每干成一件事到底花多少钱——三个问题,一次拆透。

一、破题:涨 6 倍的能力,涨 3 倍的账单

先把正式版的成绩单完整摆出来。这次官方披露的 9 项基准清一色考察 Agent 实战能力——终端、代码仓库、工具调用、办公自动化,没有一项考聊天:

基准(考察方向)V4-Flash 预览版V4-Flash 正式版V4-Pro 预览版Opus-4.8
Terminal Bench 2.1(终端操作任务) 61.8 82.7 72.1 85.0
NL2Repo(自然语言生成代码仓库) 39.4 54.2 38.5 69.7
Cybergym(网络安全攻防) 38.7 76.7 52.7 83.1
DeepSWE(长程软件工程任务) 7.3 54.4 12.8 58.0
Toolathlon-Verified(多步工具调用) 49.7 70.3 55.9 76.2
Agents’ Last Exam(智能体综合评测) 15.8 25.2 16.5 25.7
Automation Bench(办公自动化) 10.8 25.1 12.8 27.2
DSBench-FullStack(前后端全栈开发) 37.0 68.7 41.8 71.6
DSBench-Hard(高难编程任务) 25.8 59.6 31.1 71.7

这张表里有三个事实,一个比一个值得嚼。

第一,架构一个字没改,只重做了"后训练"。 V4-Flash-0731 的模型结构、参数规模和 4 月的预览版完全一致——284B 总参、13B 激活、256 个专家。所谓后训练,就是不动预训练基本功,只针对具体能力做强化训练:同一个底座,换一套训练方案,专攻代码修改、工具调用和多步骤执行,DeepSWE 就从 7.3 拉到 54.4。这个 7.3 分什么概念?DeepSWE 是 113 个真实开源仓库里的长程编程任务,7.3 分意味着基本干不了活,54.4 分意味着能独立干成一半以上。

第二,小弟把大哥超了。 9 项基准,V4-Flash 正式版全面反超 V4-Pro 预览版——一个 284B 的"经济版",把 1.6T 的"旗舰预览版"按在地上摩擦。Pro 正式版还没发,DeepSeek 说"尽快",但 Flash 这一手已经把预期拉满了。

第三,离天花板只差一口气。 Terminal Bench 82.7 对 Opus-4.8 的 85.0,只差 2.3 分;Agents’ Last Exam 25.2 对 25.7,基本贴身。开源模型在 Agent 能力上第一次摸到了闭源旗舰的衣角。

但你要是只盯着这张表,就被分数带沟里去了——上面全是"能力"账,没有"成本"账。我真正在意的数字在另一份报告里:海外评测机构 Artificial Analysis 在 7 月 31 日更新的智能指数里,给 V4-Flash-0731 打了 50 分,同类可比模型中位数只有 17 分。高分不稀奇,稀奇的是评测过程的 token 消耗:V4-Flash-0731 整场评测生成了 2.1 亿 token,可比模型中位数是 6200 万。

3.4 倍。这就是 Agent 时代的隐藏账单:模型不是变聪明了才多用 token,而是用更多 token 换来了变聪明——思考链默认开启且按输出价计费(在最终答案里不可见)、多轮工具调用、长程任务反复规划,每一步都在烧 token。

能力通胀和 token 通胀同时发生,那账到底变好看了还是难看了?我提一个这套系列会反复用的概念——每成功任务成本:

每成功任务成本 = 单次尝试 token 消耗 × 单价 ÷ 任务成功率

道理很朴素:模型不是每次都能把事干成,成功率越低,越要反复重试,摊到每件"干成的事"上的成本就越高。拿 DeepSWE 粗略算一笔(把基准分近似看成任务成功率,token 消耗按 3.4 倍估,量级参考,别当精确值):

版本成功率(近似)期望尝试次数单次 token 系数每成功任务相对成本
预览版 7.3% ~13.7 次 13.7
正式版 54.4% ~1.8 次 ~3.4× ~6.3

结论:token 消耗涨了 3 倍多,但每成功任务成本反而降了约 54%——因为成功率涨得更快。这就是能力涨约 6.5 倍的财务表达:不是"更贵了",是"终于干得成事了,而且干得成的前提下还更便宜了"。

这也是我要提醒的第一件事:从这一代模型开始,“每百万 token 多少钱"的指标正在失效,你真正该问的是"每干成一件事多少钱”。而要回答这个问题,得先搞懂 V4 的架构把成本结构改成了什么样。

二、架构账:显存墙挪了个位置

V4 Flash 能把部署门槛压下来,靠的是技术报告里的三板斧。先给规格卡,再逐项拆:

维度V4-Flash备注
总参数 / 激活参数 284B / 13B 256 个路由专家,每 token 激活 6 个
层数 / 隐藏维度 43 层 / 4096 V4-Pro 是 61 层 / 7168
上下文 1M token CSA+HCA 混合稀疏注意力
官方权重精度 FP4(专家)+ FP8(其余) 权重体积 ~160GB
预训练数据 32T token 4K→16K→64K→1M 渐进扩展
许可证 MIT 商用、微调、再分发均无限制

三板斧分别是:混合专家架构(MoE,284B 权重分成 256 个专家,每 token 只激活 6 个、动用 13B)、CSA+HCA 混合稀疏注意力(“先摘要再精读”,把 KV cache 沿序列维度大幅压缩)、FP4 量化感知训练(权重精度从 FP8 压到 FP4,体积再砍一半)。

效果有多极端?这里要引入一个关键概念:KV cache(上下文缓存,相当于模型的"短期记忆")——输入的内容模型都要留着才能继续生成,上下文越长、并发越高,KV cache 占的显存就越大,这向来是长上下文部署的第一道墙。技术报告给的对比口径是:1M 上下文下,V4-Flash 单 token 推理算力只有上代 V3.2 的 10%,KV cache 只有 7%。换算成显存数字,百万 token 上下文的 KV cache 从近百 GB 压到约 10GB;而 V4-Flash 自身的权重,从 FP8 的 568GB 经 FP4 混合精度压缩后,只剩约 160GB。

好,重点来了:这组数字对选卡意味着什么?意味着显存墙挪了个位置——从"装不下"变成了"喂不饱"。

上一代模型的核心矛盾是容量——671B 模型光权重就 1.3TB,KV cache 还随上下文长度膨胀,中小团队连"把模型装进显存"这一步都过不去。V4 Flash 把容量墙直接拆了:160GB 权重 + 10GB 级 KV cache,两张 H200 装得绰绰有余,消费级多卡拼一拼也能够着。

但装下之后,新的瓶颈暴露了:

  • 带宽墙:每生成一个 token,都要把这一步激活的专家权重从显存里完整读一遍——读得慢,生成就慢。大模型推理是典型的 memory-bound(带宽受限)负载:GPU 算力利用率常常只有 30%-50%,剩下的时间都在等显存喂数据。卡脖子的是显存带宽,不是算力。

  • 互联墙:256 个专家分散在多张卡上,每生成一个 token、每过一层,卡间都要做一次 all-to-all 通信(专家间的数据互换)。互联慢,专家并行省下的算力就被通信吃回去了。

记住这个判断,后面四种角色的实测数据都在为它作证:V4 之后选卡,别再死磕 TFLOPS,要看带宽、显存、互联这三件套。而架构把部署门槛降下来,还有一层含义——你能便宜地部署,是因为有人替你付了训练的钱。这笔"后训练红利"本身,又是花多少钱造出来的?

三、训练账:红利很贵,但能反复收割

先说清楚一件事:训练离大多数读者很远,但训练侧的账本决定了推理侧每个人能捡到什么便宜。这章我压到最短,只讲三个数。

第一个数:一次预训练,N 次收割。 正式版能力涨约 6.5 倍全靠重做后训练,方法叫 OPD(On-Policy Distillation,在线策略蒸馏)——先按领域分别训出一批专科专家(数学、代码、Agent、指令跟随各练各的),再让一个学生模型把所有专家的能力一次性蒸馏过来。这套范式替代了上一代多目标混训的方式,避免了能力互蚀——同一个底座突然涨 6 倍,秘密就在这。

翻译成经济学语言:32T token 预训练是一次性投入的固定资产,后训练是可以反复重做、按场景定制的流水线。底座不动,每重做一轮后训练,就收割一波能力红利。V4-Flash 预览版到正式版,就是第一次公开收割。对部署侧的含义很实际:未来你会看到同一个底座冒出一堆后训练变体,"一个底座服务多个变体"的资源池化能力,会成为推理平台的基本功。

第二个数:全参训练的入场券,月租 400 万。 如果你想在开源权重的基础上亲自回炉——不是小修小补的微调,是正儿八经的全参数续训练——显存账是这么算的:

显存组件AdamW 口径Muon 口径(V4 实际用)
模型权重 568 GB 568 GB
梯度 568 GB 568 GB
优化器状态 2,272 GB 1,136 GB
激活值+缓冲 ~600 GB ~600 GB
合计 ~4.0 TB ~2.9 TB

按 80GB 单卡留 30% 余量算,起步要 64 张 H800(8 节点 × 8 卡,InfiniBand 互联)。2026 年的租赁行情,H800 月租 6.3-6.4 万/卡,64 卡就是约 400 万/月——这还只是全参续训练的门槛,不是 32T token 预训练(那是万卡集群月级别的投入,不在本篇展开)。

表里还有一处少有人提的细节:V4 用 Muon 优化器替代传统的 AdamW,除了收敛更快,还有个隐性红利——优化器状态只存动量、不存二阶矩,相当于少记一份账,显存直接省出一个 TB 级。这是"架构设计替训练省钱"的又一例。

第三个数:国产算力,1 个月、1500 步、算力利用率 30%。 既然英伟达的训练集群这么贵,能不能用国产卡来训?这是谣言最多的地方,先纠正一个流传很广的说法。科大讯飞在今年 5 月的业绩会上澄清得很直白:媒体报道的"V4 在昇腾上训练"不准确,实际只是基于昇腾做了推理适配,DeepSeek 自己的训练仍然基于英伟达卡。

事实分三层:

层面真实情况
DeepSeek 自身训练 英伟达 H 系列集群
第三方训练验证 深圳河套学院联合哈工大(深圳)、华为等,昇腾 910C 千卡集群,1 个月跑通 V4-Pro(1.6T)全参数续训练,长稳训练 1500+ 步,算力利用率超 30%,关键算子效率提升 14%
推理适配 昇腾 A2/A3/950 全系 Day0 支持;寒武纪基于 vLLM 完成 Day0 适配;智源 FlagOS 在海光、沐曦、摩尔线程、昆仑芯等 8 款以上芯片完成 V4-Flash 全量适配

表格第二行那次验证,是业界首个基于国产算力完成的 V4-Pro 全参数后训练工程实践。算力利用率 30% 这个数字单看不起眼(英伟达集群优化好的能到 40%-50%),但它是"能不能"到"稳不稳"的分水岭。

更值得记的是技术报告里的一句话:V4 的专家并行(EP)方案——把 256 个专家分摊到大规模卡群协同——同时在英伟达和昇腾两个平台上完成了验证。这意味着芯模联动不是事后适配,是设计阶段就写进架构的。记住这句话,第四章讲昇腾 950 时它会回来。

训练侧的账就这么多。一句话收个尾:红利是真的,但红利是重资本造出来的——个人和小团队别碰训练,把力气全押在推理侧。那推理侧到底该怎么押?我按角色拆,一种角色一本账。

四、推理账:四种角色,四本账

这一章是全文的重头。不按预算分档,按角色分——同一块卡,在不同角色手里是完全不同的账:个人要"够用",企业要"稳定",工厂要"并发容量",模型厂商要"定价权"。每个角色只给实测数据和一个判断。先给一句总纲:能跑 ≠ 能用 ≠ 能赚钱——三者的分界不在"能不能加载模型",在"你的负载形状下速度够不够用"。

4.1 个人开发者(预算 5-15 万):消费卡的"能跑陷阱"

第一种角色最简单,也最容易踩坑。先泼一盆冷水:V4-Flash 官方权重 160GB,任何单张消费卡都装不下。社区流传的"单卡 4090/5090 跑 V4-Flash",真相是 offload——把大部分专家权重卸载到系统内存(需要 128GB+)甚至 SSD 里,显存只做热缓存,每步计算现换入。所以别被"显存占用 22GB"迷惑,那是缓存水位,不是模型体积。

社区实测数据汇总:

配置方案速度并发 / 上下文上限判断
单卡 RTX 5090 24GB + 大内存 INT4 offload ~12 tok/s 2-3 路 / 128K 能跑,谈不上能用
4×RTX 4090 24GB(96GB) INT4 全显存 5-10 tok/s 个位数 / ≤64K 原型验证级别,质量损失约 5%
2×DGX Spark(256GB 统一内存) FP8 ~41 tok/s 中等 / 512K 个人甜点开始出现
3×RTX PRO 5000 72GB(216GB) FP4 原生 15-25 tok/s 有余量 / 1M Blackwell 原生支持,免转换

这些纯消费卡方案的瓶颈,正是第二章说的带宽墙+互联墙:4090 这类卡的卡间互联走 PCIe 通道,多卡张量并行效率直接折半;offload 方案则被内存带宽锁死。一句话:单卡也好、四卡也好,纯消费方案买来学习和做原型没问题,别指望扛生产。

但消费级方案里有个真正的惊喜——DGX Spark 集群。看数据前先补一个背景:模型推理分两个阶段——prefill(消化全部输入)和 decode(逐字生成输出);输入与历史请求重复的部分可以直接命中缓存,跳过 prefill。带着这个背景看数据——NVIDIA 开发者论坛上有一套 4 节点 Spark 实测(4 节点张量并行,总成本约 2.05-2.11 万美元,折合人民币 15 万),跑的就是正式版 V4-Flash-0731,数据难得地完整:

场景首字延迟输入处理(prefill)生成速度(decode)
1 路并发,50K 上下文,无缓存 ~20 秒 2,548 tok/s 93 tok/s
1 路并发,150K 上下文,缓存命中 0.78 秒 等效 19.3 万 tok/s 90 tok/s
6 路并发,150K 上下文,缓存命中 4.3 秒 40 tok/s/路
6 路并发,150K 上下文,无缓存 超时* 1.28 tok/s

注:"超时"指请求在测试观察窗口(分钟级)内未返回首字。同一套硬件、同样的并发数,唯一变量是有没有缓存命中。

表里最后一行是最有价值的负面证据:6 路并发同时灌入 150K 新上下文,这套 15 万的集群直接崩给你看——请求超时、decode 掉到 1.28 tok/s。而缓存命中后,等效 prefill 飙到 19.3 万 tok/s,首字延迟不到 1 秒。

同一个集群,负载形状换一下,体验天差地别。这就是"能跑 ≠ 能用"的实锤:Spark 集群的甜区是"长文档 + 高缓存命中"(RAG、多轮 Agent),死穴是"多路并发冷启动长上下文"。买之前先想清楚你的负载长什么样。

所以个人开发者这本账其实一句话:消费卡用来学,API 用来干活。为什么 API 更划算?第五章用数字说话。

4.2 企业私有化部署(预算 40-50 万,或月租 16 万):2×H200 是当前最优解

第二种角色是企业。和个人玩票完全不同,企业私有化要的是 7×24 小时稳定生产——有并发、有 SLA、有数据合规要求。我的判断非常明确:2 张 H200 141GB,就是现阶段部署 V4-Flash 官方 FP4 版的最优解。理由三条,条条是账。

第一条,H200 和 H100 的算力一模一样。同一颗芯片,同为 989 TFLOPS,差异只在显存(80GB→141GB,+76%)和带宽(3.35→4.8 TB/s,+43%)。第二章说过,推理是 memory-bound 负载——H200 贵出来的钱,买的恰好是推理真正缺的东西。实测对这类负载提升 25%-40%,基本贴着带宽差的物理上界走。

第二条,显存配比刚刚好。2×141=282GB,装 160GB 官方权重余量 43%,剩下的全给 KV cache 和并发。而且 2 卡张量并行(TP=2)通信开销小、部署简单、故障域小——换成 4×H100 的 TP=4,工程复杂度直接翻倍。说句大实话:多花 30% 的卡钱买 H200,省的是工程人力和线上稳定性。

第三条,看实测对照。2026 年 Q2 社区数据:2×H200 本地部署单路 decode 大约 30-50 tok/s,而 DeepSeek 官方 API 是 83.8 tok/s。差距在哪?不在卡,在 serving 栈——推理框架、算子、调度、推测解码的全栈优化(这正是本系列后面要专门拆的主题,先埋个钩子)。

成本口径给两个:采购,H200 8 卡模组渠道价约 140 万(单卡约 17.5 万),整机现货报价已回升到 230 万+,配 2 卡工作站约 40-50 万;租赁,H200 月租约 8 万/卡,2 卡 16 万/月。买还是租,取决于你的负载能不能吃满——吃不满,租。

4.3 云厂商 Token 工厂(预算 300 万+):昇腾 950 超节点

第三种角色,是靠卖 token 赚钱的云厂商和算力服务商——用本系列的话说,Token 工厂。工厂的账和企业完全不同:企业按"台"买算力跑自己的业务,工厂按"并发容量"买算力卖给全社会——同样的成本,能扛的并发越高,毛利越厚。这里也是国产算力第一次在大规模推理上和英伟达正面掰手腕的地方。

昇腾 950 超节点(Atlas 950 SuperPoD)今年 WAIC 真机亮相,规格确实是冲着万亿 MoE 模型去的:

规格数值
集群规模 1024 卡(最高可扩展至 8192 卡)
算力 1 EFLOPS FP8 / 2 EFLOPS FP4
全局统一内存 256 TB
互联 灵衢协议,TB 级带宽,时延 3 微秒

华为官方公布的 V4 实测(注意口径:离线推理环境,不含真实服务的调度和负载均衡损耗):V4-Flash 在 8K 输入、每 token 生成间隔约 10ms 的约束下,单卡 decode 聚合吞吐 1,600 TPS;V4-Pro 在 20ms 约束下 4,700 TPS。昇腾 A3 64 卡超节点走大规模 EP,V4-Flash 也能跑到单卡 2,000+ TPS。

别拿这个 1,600 和 H200 的 30-50 直接比——前者是高并发下的单卡聚合吞吐,后者是单路 decode 速度,不是一个物种。真正可比的是单位成本下的并发容量。

而并发容量恰恰是 950 的主场:1024 张卡共享 256TB 统一内存(整个集群像一台电脑),256 个专家在超大内存池里摊开,all-to-all 通信走 3μs 的灵衢互联,恰好把第二章说的互联墙拆了。V4 的架构痛点,和 950 的架构卖点,是对齐的——这不是巧合,是第三章那句"EP 双平台验证"的落地。

硬件这半本账先记到这。工厂的另半本账——并发拉满为什么还可能亏钱——是下一篇的主题。

4.4 模型厂商:一行小字里的定价权

最后一种角色,不买卡也不卖卡,却决定了上面所有人的账——模型厂商。还是"EP 双平台验证"那句话:4.3 讲的是它对硬件格局的影响,而它对定价格局的影响,藏在 DeepSeek 今年 4 月官宣 V4 时图片下方的一行小字里:

“受限于高端算力,目前 Pro 的服务吞吐十分有限,预计下半年昇腾 950 超节点批量上市后,Pro 的价格会大幅下调。”

先看这行小字预告的价格走势(V4-Pro API,每百万 token,人民币):

时间点输入输出背景
4 月官宣 12 元 24 元 小字自曝"受限于高端算力"
6 月 1 日永久调价 3 元 6 元 昇腾 950 超节点预计下半年批量上市

我干计费系统这么多年,第一次看到厂商把"等某款芯片量产"写进自家 API 的定价预告。这句话翻译过来是:模型定价的上限,已经被硬件产能直接锁死;芯片一上量,价格就下来。走势完全应验了表里的数字——6 月 1 日一刀砍掉 75%,而且是"永久"调价,标准的膝盖斩。

这行小字,不同角色的读法完全不同:个人和企业读到的是"再等等,API 还会更便宜";云厂商读到的是"原厂降价的刀随时会落下来";芯片厂商读到的是"产能就是定价权"。芯模联动不再是技术口号,是定价策略——这是 V4 这一代给行业上的最深一课。

五、账单实战:按月任务量选型,别按月 token 量

四种角色四本账,这一章把前三本落到实处:每个月该为 V4-Flash 花多少钱,走 API 还是自建。(模型厂商那本不在这算——定价权游戏你左右不了,只能顺势而为。)

个人、企业、工厂,规模差着几个数量级,但成本侧用的是同一把尺子。这把尺子得先换:过去大家按"每月用多少 token"做预算,Agent 时代要改成按"每月要干成多少件事"做预算。因为一次 Agent 任务的 token 消耗少则几千、多则几十万,按 token 估预算,一估一个错。

先看官方 API 的完整定价(每百万 token,人民币)。"缓存命中"指输入与历史请求重复、直接复用缓存结果——Agent 场景最狠的折扣就在这一项:

时段输入(缓存命中)输入(未命中)输出
平时 0.02 元 1 元 2 元
高峰(每日 9-12 点、14-18 点) 0.04 元 2 元 4 元

三个要点:

  • 缓存命中价是未命中的 1/50——Agent 任务多轮对话,历史内容大量重复,把命中率做到 95% 以上,输入侧近乎免费(Spark 实测里缓存命中后的 19.3 万 tok/s,是同一件事的硬件版)。

  • 高峰翻倍,且恰好覆盖企业办公时段——这是原厂在用价格削峰填谷,能挪到夜里的定时任务尽管挪。

  • 思考链按输出价计费,且在最终答案里不可见——Agent 任务的账单里,思考链 token 常常占输出的大头。

然后算每任务账——把第一章的"每成功任务成本"代入真实单价。一次 DeepSWE 级别的长程 Agent 任务,按 10-30 万输出 token 估(含思考链):V4-Flash 非高峰约 0.2-0.6 元/次;同样的 token 量走 Opus-4.8(输出每百万 token 25 美元),约 19-55 元/次。接近百倍的单价差,再叠加 Terminal Bench 上那 2.3 分的差距——这就是"性价比之王"的精确含义。

最后给决策表。按月成功任务量分档,逐行对应第四章的角色,这是本文最值得截图的一张表:

月成功任务量(对应角色)建议方案月度成本量级判断依据
< 1 万次(个人) 纯官方 API < 5,000 元 任何自建方案的设备折旧都远超这个数
1-10 万次(个人/小团队) API + 缓存/错峰优化 0.3-3 万元 把命中率做到 95%+,夜间跑批,成本再砍一半
10-50 万次(企业) API 为主;有数据合规刚需再自建 API 3-15 万元 合规场景上 DGX Spark 集群(约 15 万)或 2×H200(月租 16 万),但先想清楚负载形状匹配哪类硬件
50-200 万次(企业私有化) 2×H200 自建进入盈亏平衡区 16 万元级 50 万次 × 0.3 元 ≈ 15 万 API 费 ≈ 2×H200 月租,自此自建开始划算
> 200 万次(云厂商 Token 工厂) 集群自建或昇腾超节点,日常自建 + 高峰 API 兜底 项目制 并发容量和稳定性取代单价成为主要矛盾

表背后只有一句心法:API 和自建之间不存在"越早自建越省",只存在"越过盈亏平衡点才省"——而这个平衡点,Agent 时代被推高到了每月几十万次任务,比绝大多数人直觉的高得多。手里攥着 4 张 4090 想替代 API 的,先把月任务量数清楚再下单。

六、结语:分数看热闹,账单看门道

回到开篇的三组数字:能力涨 6 倍,token 消耗涨 3 倍,对冲之后每成功任务成本降 54%——这才是能力涨约 6.5 倍的正确打开方式。而 V4-Flash 正式版给这个系列开了个极好的头,因为它把接下来要拆的所有问题都预埋好了:

  • 每成功任务成本——Agent 时代的成本计量单位,后面每篇都会用到;

  • 显存墙位移——容量墙拆了,带宽墙和互联墙还在,选卡逻辑因此重写;

  • 芯模联动定价——模型厂商把芯片产能写进定价预告,这在云计算史上是头一遭。

我的最终建议,按角色对号入座:个人开发者,API 为主,Spark 集群玩票可以、扛生产别想;企业私有化,盯紧 50 万次/月这条盈亏线,过了线再上 2×H200;云厂商 Token 工厂,昇腾 950 超节点 + serving 栈优化是长期解,但先把离线口径和服务口径的账分开算。

还有一个问题本文故意没展开:模型权重免费、架构论文公开,理论上谁都能部署——那为什么云厂商部署出来的成本还是原厂的三倍,月亏百万的大有人在?分数可以靠后训练追平,成本差距为什么追不平?

下一篇预告:《Token工厂陷阱:用量越多,亏得越多!》

关注本系列,下篇继续拆。 觉得有用的话,转发给你身边正在做大模型部署决策的朋友。

文中数据基于 2026 年 8 月前公开信息整理,基准分数、定价和硬件行情迭代很快,具体数字请以各平台最新披露为准。欢迎同行交流拍砖。

赞(0)
未经允许不得转载:171主机测评 » 能力涨6倍,Token烧3倍:V4-Flash正式版的真实账单
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址