9 月 8 日,DeepSeek 在官方交流群里悄无声息地放出了一个内测模型——V4.1 Flash 中间版本。没有发布会,没有 Change Log,官网和 API 文档里也查不到任何正式记录。但消息在开发者圈子里传得飞快:有人把它的长文本推理速度测到了 420 tokens/s,有人拿它和 V4 Flash Vision-Exp 做同任务对比,端到端快出了 3.9 到 6 倍。
这篇文章不吹不黑,把这次内测的来龙去脉、技术细节、调用方式、实测数据和背后的信号,一次性拆给你看。尤其是最后那个问卷——官方问"Flash 能不能取代 Pro",这句话背后的分量,比任何 benchmark 都重。
一、一次"非正式发布":临期端点的两天窗口
先厘清一件事:这不是正式发布,而是一次中间 checkpoint 的灰度测试。
截至相关报道发出时,DeepSeek 官网、API 官方文档和 Change Log 中都没有 V4.1 Flash 的正式发布记录。公开 API 文档上仍然只列着三个模型:
- DeepSeek-V4-Flash-0731
- DeepSeek-V4-Pro-0813
- DeepSeek-V4-Flash-Vision-Exp
新模型是通过官方交流群放出的,模型 ID 本身就泄露了它的性质——deepseek-v4.1-flash-expires-on-0910。名字里那个 expires-on-0910 直白地告诉你:这是一个 9 月 10 日到期的临时测试端点,测试窗口大约只有两天。
换句话说,DeepSeek 是在正式版本拍板之前,把一个中间 checkpoint 塞进了真实 API 环境做短期灰度。据 OrcaRouter 的爆料,官方明确建议开发者不要把它硬编码进生产环境,保留 deepseek-v4-flash 作为回退路径。 
对开发者来说,“中间 checkpoint + 临期端点"这套玩法值得品一品。传统的模型发布是"训完 → 内部评测 → 官方定版 → 全量上线”,周期长、反馈慢。而把中间版本直接丢进真实 API 做灰度,等于让用户在真实负载下帮官方攒数据:哪些任务快了、哪些翻车了、并发扛不扛得住,全部可视化。这跟互联网产品做 A/B 测试是同一个思路,只是对象从"功能"换成了"模型权重"。
它的另一层含义是:你有机会提前摸到下一代,但也得接受它随时会被撤走。端点一到期,deepseek-v4.1-flash-expires-on-0910 这个名字就变成 404 了。
二、调用方式:改个模型名就上车
上车成本几乎为零。DeepSeek 的 API 是 OpenAI 兼容的,所以不用改 base_url,只改模型名即可:
from openai import OpenAI
client = OpenAI(
api_key="sk-xxxxxxxx",
base_url="https://api.deepseek.com", # 无需修改
)
resp = client.chat.completions.create(
model="deepseek-v4.1-flash-expires-on-0910", # 只改这里
messages=[
{"role": "user", "content": "用 SVG 画一个深色主题的折线图"},
],
)
print(resp.choices[0].message.content)
既然端点是临期的,生产代码里最稳妥的做法是把模型名放进配置,过期后一键回退,而不是散落在各处的字符串:
import os
# 临时端点 9 月 10 日到期,回退路径写死
MODEL = os.getenv("DEEPSEEK_MODEL", "deepseek-v4-flash")
def chat(messages):
return client.chat.completions.create(model=MODEL, messages=messages)
这样等端点到期,你只需要改一个环境变量,业务代码一行都不用动。
但有一点必须提醒:内测每账号只有 20 路并发,而正式版并发上限是 2500。20 路这个量级,只够做功能验证和效果测试,别指望它承接线上业务。所以哪怕你心再急,也请把重负载留在 deepseek-v4-flash 上。真要有高并发压测需求,等正式版放量了再说。
三、计费:同价不降价,但账单可能变快
很多人看到"成本更低"四个字,以为要降价了。实测下来,每 token 的价格一分没动。
内测模型计费与 deepseek-v4-flash 完全一致,每百万 Tokens:
| 空闲时段 | 0.05 元 | 1.5 元 | 4.5 元 |
| 高峰时段 | 0.1 元 | 3 元 | 9 元 |
官方说的"成本更低",其实指的是底层推理效率/服务成本的提升,而不是开发者账单直接下降。这一点在社区里已经翻车了一波:有开发者反馈"5 分钟烧了 10 块钱"。
为什么会这样?恰恰是因为速度太快了。同样 5 分钟,你的程序能吐出多得多的 token,单位时间的消耗自然上去了。这是"效率红利"和"账单体感"之间一个挺反直觉的错位——对按 token 计费的开发者来说,快,不等于便宜。
再叠加一个细节:缓存命中输入和未命中输入,价格差了 30 倍(空闲时段 0.05 元 vs 1.5 元)。这意味着新模型的长上下文能力如果真的大幅提升,你在 prompt 里塞更多上下文的同时,也得把缓存策略做好,否则账单会被未命中的输入顶上去。速度快了 5 倍、上下文塞多了 5 倍,两个因素叠加,单次请求的钱未必省得下来。
四、架构层面的真变化:原生多模态 + 全新结构
这次内测真正值得关注的,是架构层面的两处"第一次"。
第一,原生多模态。官方首次明确"原生多模态支持",即模型出厂自带图文一体化的输入输出。这跟 8 月 21 日上线的 V4-Flash-Vision-Exp 是两条技术路线——后者是"外挂式",在纯文本底座上外接视觉编码器和对齐器;而 V4.1 Flash 是原生内置。
两者对开发者的差异在于:外挂式方案里,视觉信号要经过编码器转译、对齐器桥接,再喂给文本模型,中间存在信息损耗和额外延迟;原生方案则是图文在一个模型里共享表征,理论上理解更一致、响应更快。这次实测里 SVG 生成快 6 倍,某种程度上就是这条路线跑通的佐证。
第二,全新模型结构。此前 V4 Flash 是在保持原架构的基础上只做 Post-training;而这次官方明确采用了全新模型结构。这指向的是结构性变化,而非单纯的数据微调。不过需要注意,参数规模、架构细节、benchmark 成绩,官方目前一律没有公布——想抄底技术细节的,得再等等。
这两处叠加,传递的信号很清晰:V4.1 这一代不是"继续堆料",而是在底座层面动了手术。
五、实测数据:SVG 快 6 倍,长文本 420 tokens/s
模型到底强不强,数字说话。目前社区拿到的数据分两类:绝对速度和端到端加速倍数。
绝对速度上,据 36kr 报道的社区实测:
- "你好"这种简单对话,思考时间仅 0.3 秒,生成速率 159.3 tokens/s;
- 长文本推理生成速度可达 420 tokens/s,相比上一代提升明显。
端到端加速更有说服力——与 V4 Flash Vision-Exp 做同任务对比:
| SVG 代码生成 | 6.0x |
| 49k 长上下文检索 | 5.2x |
| SQL 查询生成 | 5.0x |
| Manacher 算法题 | 4.6x |
| asyncio 重构 | 3.9x |

几个数字里最值得玩味的是 SVG 生成 6.0x 和 长上下文检索 5.2x。前者对应原生多模态带来的图文生成效率,后者对应长上下文能力的结构性提升——这两个方向恰好就是新架构主打的卖点,数据上是自洽的。
但这里必须给读者泼盆冷水:这类"同任务端到端加速倍数"高度依赖任务形态和对比基线。别人的 SVG 快 6 倍,不代表你的 RAG 场景也能快 6 倍;而且对比对象是上一代的 Vision-Exp,不是同代对手。把这类数字当成"我迁移过去一定快 5 倍"的承诺,是要吃亏的。正确的用法是拿它当方向性信号:代码生成和长上下文检索这两类任务,可能是新架构收益最大的地方,值得优先验证。
六、一个意味深长的问卷
内测附带的飞书反馈问卷里,有一个问题直白得让人侧目:
V4.1 Flash 中间版本能否全面替换线上的 DeepSeek V4 Pro?
这句话的分量,得放在价格差里看。V4 Pro 的价格大约是 Flash 的 3 倍。如果官方自己都在认真评估"Flash 级能不能取代 Pro 级",那意味着两件事:
当然,这只是问卷里的一个询问,不是定论。把它当成"Flash 取代 Pro"的实锤,就过度解读了。但它至少是一个明确的官方态度:DeepSeek 自己在主动试探这条路线。
对开发者而言,这条路线如果真落地,红利是实打实的——你用三分之一的价格,拿到接近 Pro 的能力,单位产出成本直接砍半。但这同样是一把双刃剑:如果 Flash 级能力全面逼近 Pro,那么"花 3 倍价钱上 Pro"这件事,就需要重新掂量了。选型的天平,可能悄悄开始倾斜。
七、总结与展望
把这次内测拼起来看,核心信息就三条:
对于开发者,我的建议很朴素:趁着 9 月 10 日端点到期前的窗口,拿你自己真实的业务 prompt 去跑一遍。别人的 SVG 快 6 倍,不代表你的场景也能快 6 倍——这类端到端加速高度依赖任务形态。跑完留一组 A/B 数据,等正式版出来,你心里就有谱了。
而在更长远的视角里,这次内测真正重要的不是某几个数字,而是它暴露出的行业信号:轻量级模型正在逆袭主力级。当 Flash 级的旗舰特性(原生多模态、长上下文、新架构)和 Pro 级的差距被拉到一个官方都愿意公开询问"能不能替换"的程度,那"花大价钱上大模型"的旧逻辑,可能真的要开始松动了。国产大模型这一轮的内卷,卷的不只是价格,更是"用更小的代价,逼近更大的能力"这条更陡的曲线。
至于 V4.1 Flash 正式版何时上线、参数多大、跑分如何,官方一个字都没透露。但有一点可以确定:当 DeepSeek 开始把一个中间 checkpoint 丢出来给开发者白嫖测试的时候,正式版离我们,大概率不会太远了。
参考来源
- 36kr:DeepSeek V4.1 Flash 内测相关报道
- OrcaRouter:DeepSeek V4.1 Flash Leak
- 阿里云开发者社区:V4.1 Flash 调用方式与计费
- 澎湃新闻:原生多模态与新架构解读
- 新浪科技:成本争议与开发者实测


