北京时间9月3号凌晨,谷歌上线 Gemini 3.8 Flash,六周内的第三代,离 3.7 发布才 20 天。发布前后,Meta AI 负责人 Alexandr Wang 发完自家新模型,顺手阴阳了一句「我真不想这么说,但是……Gemini是谁?」
大佬斗嘴是乐子,但把跑分、实测数据、官方文档和价格表翻完之后,有一批信息对天天写调用代码的人更有用。这篇笔记把它们整理好,最后给一个我目前在用的工程做法,你可以直接对照自己的项目检查一遍。
先看数据,再看热闹
跑分层面,3.8 Flash 确实能打。海外媒体的统计里,长周期编程测试 DeepSWE 上它拿了 71 分,离 Opus 5 只差 3 分。
实测层面的对照更有意思。有开发者拿四个物理场景做了同题测试,数字放一起看很直观
|
对比项 |
Gemini 3.8 Flash |
Opus 5 |
|
四个场景总成本 |
0.12 美元 |
1.86 美元 |
|
单场景耗时 |
不到 70 秒 |
最慢近 5 分钟 |
|
城市场景细节 |
放了 6 棵树 |
塞了 1840 棵 |
快是真快,便宜也是真便宜,细节糙也是真糙。同一座城,一边 6 棵树一边 1840 棵,这个差距跑分上看不出来。如果你的调用是要交付给客户的东西,这组数据比 DeepSWE 那 3 分值得多看两眼。
官方文档里那句劝退
比跑分更值得琢磨的,藏在谷歌官方文档的一个角落里。效率优先的任务,可以调低推理档位,或者干脆继续用三周前的 3.7 Flash。厂商亲口劝你别追新,这在行业里相当罕见。
另一条线索是 Gemini 3.5 Pro 的取消。它被砍掉的一个重要原因,就是相对 Flash 提升不明显。两条信息放一起读,信号挺清楚,旗舰路线在收缩,性价比档位在提速。
开发者要记的两件事
一,那张 2027 年 1 月 1 日生效的价格表
价格表上有个很多人没看的小字
|
模型 |
促销到期日 |
现价参考 |
|
Gemini 3.8 Flash |
2027-01-01,之后翻倍 |
输入 0.75 美元/百万Token,输出 3.75 美元/百万Token |
|
Gemini 3.7 Flash |
同一天 |
同样是限时促销价 |
现价是限时促销价,明年 1 月 1 日起翻倍,而且两代促销价同一天到期。也就是说,退回上一代躲不过这一天。只要项目还在跑、成本按现价测算,到时预算就对不上。模型没变,账单变了。
二,版本号别写死在业务代码里
模型侧三周一换代,档位、价格、能力边界每代都在动。业务代码要是和具体版本号长在一起,每次换代都是一轮全项目排查。我的思路是把「声明能力」和「指定版本」分开
# 版本耦合的写法,模型名散落在业务代码里
resp = client.chat(model="gemini-3.8-flash", messages=msgs)
# 版本解耦的写法,业务代码只要一个档位,具体版本交给接入层路由
resp = client.chat(model="flash-tier", messages=msgs)
上面是示意代码,关键是让升级和回退变成改一行配置的事,而不是一次代码审查。真到促销价集体到期那天,你评估升还是不升,手里要有的是这个自由度。
顺着这个思路再往前一步,就是企业场景里的统一接入层。我们做魔芋 MAI Gateway 时解决的正是这个问题,在业务和各家模型之间放一层统一接入,上游换代、调价、改规则,下游代码基本不用动。四级预算管控加精细分账,哪个模型烧的钱、哪个部门花超了,日志里自己能查。全链路可追溯,月底对账不用只信厂商口径。




