DeepSeek 多模态终于来了。

这次上线的是实验性视觉模型:
DeepSeek-V4-Flash-Vision-Exp
API 模型名:
deepseek-v4-flash-vision-exp
它不仅支持文字,还加入了图片输入、截图理解、OCR、图表分析等能力,并且可以直接接入 Codex。
但问题也来了:
这个多模态模型到底怎么样?加入视觉能力后,代码和 Agent 能力会不会下降?
一、DeepSeek 多模态到底怎么样?
先看这次公布的 Benchmark。

1. 文本 Agent:基本没有因为多模态而“降智”
和 DeepSeek-V4-Flash-0731 相比,Vision-Exp 在 7 项文本 Agent 测试中,6 项成绩更高。
比较明显的有:
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
其中 DeepSWE 59.3,甚至超过了 Opus-4.8 的 58.0。
Toolathlon-Verified 则达到 75.9 vs 76.2,已经非常接近 Opus-4.8。
也就是说:
DeepSeek 并没有为了“看图”,明显牺牲原本的文本 Agent 能力。
2. 多模态 Agent:已经摸到 Opus-4.8
真正值得看的还是多模态测试。
| ApexBench | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | – | 65.0 |
| ZeroBench | 35.0 | – | 34.0 |
这里很有意思。
Agents' Last Exam:
Vision-Exp 27.3
> Opus-4.8 25.7
ZeroBench:
Vision-Exp 35.0
> Opus-4.8 34.0
而 Chartography:
64.3 vs 65.0
几乎已经贴近 Opus-4.8。
所以从这张测试表来看,我对它的评价是:
文本 Agent 能力没有明显缩水,多模态 Agent 已经进入第一梯队,部分项目甚至超过 Opus-4.8。
当然,这不代表 Vision-Exp 已经“全面超过 Opus-4.8”。
毕竟目前还是 Exp 实验版本,Benchmark 也不能完全代表真实开发体验。
但作为 DeepSeek 第一个重点面向视觉 Agent 的模型,这个成绩已经相当不错。
二、它对 Codex 有什么用?
以前用 Codex 写代码,碰到:
-
IDE 报错截图
-
网页截图
-
UI 设计稿
-
数据图表
-
控制台错误
很多时候需要自己先整理成文字。
现在可以直接:
图片 / 截图
↓
DeepSeek-V4-Flash-Vision-Exp
↓
视觉理解 / OCR / 图表分析
↓
Codex 分析并执行代码任务
这也是我认为这次更新真正有价值的地方:
AI 不只是读代码,还开始能看开发环境。
三、Codex 保姆级接入 Vision-Exp

整个流程其实很简单:
安装 Codex → 运行官方脚本 → 选择第 3 项 → 输入 API Key。
1. 安装 Codex
确保已经安装 Node.js,然后执行:
npm install -g @openai/codex
检查:
codex –version
2. 运行 DeepSeek 官方脚本
Windows 打开 PowerShell:
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
macOS / Linux:
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)
运行后会出现模型选择菜单:
1. deepseek-v4-flash
2. deepseek-v4-pro
3. deepseek-v4-flash-vision-exp
…
9. 恢复默认 Codex 配置
想使用图片输入,直接选择:
3
也就是:
deepseek-v4-flash-vision-exp
第 3 项会额外支持图片输入。
首次运行会提示输入 DeepSeek API Key:
sk-xxxxxxxxxxxxxxxx
API Key 可以在 DeepSeek Platform 获取。
整个配置流程就是:
安装 Codex
↓
运行官方脚本
↓
选择第 3 项
↓
deepseek-v4-flash-vision-exp
↓
输入 API Key
↓
开始使用
如果之后想恢复原来的 Codex 配置,重新运行脚本,选择:
第 9 项
即可。
四、实际可以怎么玩?
例如直接把报错截图交给 Codex:
分析这张报错截图,找到错误原因,
并检查当前项目修改对应代码。
或者上传 UI 设计稿:
根据这张 UI 设计稿检查当前页面,
找出样式差异并修改代码。
最终工作流就变成:
看截图 → 理解问题 → 分析代码 → 修改项目 → 验证结果。
总结

如果只看这次 Benchmark,我认为 DeepSeek-V4-Flash-Vision-Exp 的表现比预期更好。
文本 Agent:相比 V4-Flash-0731,大部分测试继续提升。
多模态 Agent:已经接近 Opus-4.8,Agents' Last Exam、ZeroBench 甚至实现反超。
再加上现在可以直接通过官方脚本接入 Codex:
Codex
+
deepseek-v4-flash-vision-exp
↓
多模态 Coding Agent
所以这次并不是简单给 DeepSeek 加了一个“看图”功能。
真正值得关注的是:DeepSeek 开始把视觉能力和 Coding Agent 正式结合起来了。
不过 Vision-Exp 目前仍然是实验版本,适合尝鲜和测试,生产环境建议继续观察稳定性。


