适用读者:后端/全栈工程师、平台工程负责人、CTO、AI 工具选型者、对 AI 编程代理感兴趣的研究者。
0. 一句话定位(2026 版)
OpenAI Codex 已经不是"一个模型",而是一套由 Codex 系列模型 + 云端隔离沙箱 + 本地 CLI/IDE/桌面端组成的软件工程智能体(Software Engineering Agent)平台。 它能在隔离环境里读仓库、改多文件、跑测试、修报错、开 PR,并把过程日志交给你审;你给它一个任务,可以去喝咖啡,回来收一个可 review 的 diff。
1. 两次生命:Codex 是怎么从 Copilot 的"发动机"变成 Agent 的
1.1 第一世:2021 年的 Codex(补全模型)
-
本质:基于 GPT-3 微调的代码生成模型,API 名如 code-davinci-002。
-
能力边界:注释/函数名 → 补全下一行或下一个函数;单文件、无执行、不知测试能否通过。
-
历史角色:它是 GitHub Copilot 第一代补全能力的供血引擎,定义了"AI 写代码"的第一波认知。
-
结局:2023 年 3 月 OpenAI 弃用原 Codex API,Copilot 切到 GPT-4 系;但"Codex"这个名字被保留下来。
1.2 第二世:2025–2026 的 Codex(Agent 平台)
|
形态 |
补全模型 API |
云端/本地软件工程 Agent 平台 |
|
驱动 |
GPT-3 监督微调 |
codex-1(o3 系 RL)→ GPT-5-Codex 系 |
|
工作流 |
输入→输出,一次性 |
规划→编辑→跑工具→观察→修复→再跑 |
|
环境 |
无,纯生成 |
隔离 Linux 沙箱 / 本地沙箱,能 npm install、跑 pytest、开分支 |
|
交付物 |
代码片段 |
PR / feature 分支 / 修复补丁 / 架构说明 |
|
交互 |
同步补全 |
异步并行 + 人工审批 + 日志溯源 |
关键转折:
-
2025-04-16 Codex CLI 开源(Rust 写,Apache-2.0)。
-
2025-05-16 Codex Cloud 以研究预览进 ChatGPT(Pro/Team/Enterprise 先用,6 月铺到 Plus),底层 codex-1(o3 针对 SWE 的 RL 微调)。
-
2025-09 GPT-5-Codex 成为云端默认,引入 Skills / Automations。
-
2026 上半年 桌面 App、Codex Security、子代理(subagents)、GPT-5.3/5.4-Codex 相继落地。
结论:今天你说"Codex",指的是智能体系统,不是那个 2021 年的模型。
2. 架构总览:四层堆叠
┌──────────────────────────────────────────────┐
│ 接入层:ChatGPT 侧边栏 / codex.chatgpt.com │
│ Codex CLI / Desktop App / VS Code 插件 │
├──────────────────────────────────────────────┤
│ 编排层:Agent Loop + Subagents + Skills │
│ approval policy / sandbox policy │
├──────────────────────────────────────────────┤
│ 执行层:隔离沙箱(云端容器 / 本地 seccomp) │
│ git · shell · 测试·lint·typecheck·docker│
├──────────────────────────────────────────────┤
│ 模型层:codex-1 → GPT-5-Codex → 5.3/5.4-Codex │
└──────────────────────────────────────────────┘
2.1 模型层:codex-1 与 GPT-5-Codex 家族
-
codex-1:OpenAI o3 的软件工程特化版,用真实仓库任务做 RL,目标是对齐"人类 PR 风格 + 指令遵循 + 跑通测试"。官方披露 SWE-bench Verified:单次 72.1%,8 次采样 83.8%。
-
GPT-5-Codex(2025-09):GPT-5 的 agentic coding 特化,支持动态 reasoning effort(秒级到数小时任务)。
-
GPT-5.1-Codex-Max(2025-11):引入上下文 compaction,支持跨窗口长程一致;适应 Windows。
-
GPT-5.2 / 5.3-Codex(2025-12~2026-02):长程指令遵循跃迁,官方实验中 5.3-Codex 以 Extra High 推理连跑 25 小时、~13M token、~30k 行代码 造出一个设计工具原型。
-
GPT-5.4 / 5.4-mini / 5.3-Codex-Spark(2026 中):5.4 为综合旗舰默认;mini 做低延迟子代理;Spark 做近实时交互。
2.2 执行层:沙箱是 Codex 的命门
云端每个任务 = 一个独立容器:
-
预装你的 repo(GitHub OAuth 授权拉取)
-
默认禁外网,后可按团队策略开白名单(npm/pypi 等)
-
文件系统只写 workspace,宿主机不可见
-
网络/路径/命令受 sandbox policy 约束
本地 CLI 三种 sandbox_mode:
-
read-only:只读
-
workspace-write:改项目目录
-
danger-full-access:放开(仅建议在隔离 VM 里用 –yolo)
2.3 编排层:Agent Loop
标准循环(这也是它比聊天补全强的地方):
解析任务与 AGENTS.md / 项目文档
规划(plan)
编辑代码(edit)
调用工具(test / build / lint / git diff)
观察输出(logs / failures)
修复(repair)→ 回到 3
提交分支、出 PR、写总结
外部化状态(repo、diff、worktree、markdown 状态文件)让模型不靠上下文硬撑,而是靠环境反馈闭环。
2.4 接入层:四端一体
-
Codex Cloud(chatgpt.com/codex):异步大任务、并行多任务、不占本地资源
-
Codex CLI(Rust,开源):终端原住民,codex "…" 或 codex exec
-
Codex Desktop App:可视化指挥台、多项目并行、后台 automation、跨会话记忆
-
IDE 扩展(VS Code / Cursor / JetBrains):inline / chat / agent 三模式
四端共用同一 ChatGPT 账号、同一份 AGENTS.md 与配置层。
3. 核心能力拆解(不只是"写代码")
3.1 端到端任务执行
"加一个功能"不是生成片段,而是:建分支 → 改 N 文件 → 补测试 → 跑通 CI → 推 PR → 写变更说明。
3.2 异步并行多任务
云端可同时派:
-
Task A:给 payment 模块补单测到 90%
-
Task B:把所有 API 端点加 input validation
-
Task C:从 router 生成 OpenAPI 文档
三个沙箱互不阻塞。
3.3 代码库问答(Ask 模式)
只读分析架构、依赖、某次回归是谁引入的、这个 module 为什么这样写。
3.4 自主修 Bug 与测试驱动
以"测试通过"为完成信号。无测试的项目会退化成"看起来合理但不可验证"——这是使用 Codex 的前提:仓库要有可跑的测试。
3.5 长程任务(Long-horizon)
借助 markdown 持久记忆(spec/plan/status)、git worktree 隔离、reasoning effort 调节,跑数小时到二十几小时不漂移。
3.6 Subagents(2026 能力)
内置 default / worker / explorer,也可在 ~/.codex/agents/*.toml 定义自定义代理;对"按点审查 PR"可一拖 N 子代理并行,父代理汇总。代价是 token 消耗倍增。
3.7 Skills 与 Automations
-
Skills:可复用的指令+脚本包(如"做国际化抽取"、"按公司 ESLint 规则修全仓")
-
Automations:监听 GitHub Issue / CI 失败 / 定时任务,后台触发 Codex 处理
3.8 Codex Security(2026-03)
专用安全变体,自动发现/修漏洞;OpenAI 称测试期在 Chromium/OpenSSL 等扫到近 800 严重 + 上万高危问题。
4. 提示词与仓库工程化:AGENTS.md 是关键
Codex 不吃"玄学 prompt",吃工程上下文。推荐在仓库根放:
# AGENTS.md
– 安装:pnpm i
– 测试:pnpm test(单元) / pnpm test:e2e
– lint:pnpm lint && pnpm typecheck
– 分支策略:每条任务开 feat/codex-* 分支
– 禁止:不要改 schema 迁移以外的 migration 文件
– 风格:函数名 camelCase,组件用 PascalCase,注释只写 why
– 完成标准:test 全绿 + lint 零错 + 补单测
规则越像"你给 junior 工程师的 onboarding 文档",Codex 越像 senior。
任务 prompt 推荐四段式:
-
Goal:要变成什么样
-
Context:涉及模块/文件/约束
-
Constraints:不能碰什么、必须兼容什么
-
Done when:测试名、覆盖率、性能阈值
例:
/goal 把 Express 的 user router 迁移到 Hono。
Context: src/routes/user.ts、middleware/auth.ts、test/user.test.ts
Constraints: 不引入新依赖版本大跳;JWT 逻辑保持不变
Done when: pnpm test 全绿,pnpm start 起来返回 200,旧 Express 入口删除
5. CLI 实战速查
# 安装
npm i -g @openai/codex
# 或 brew install codex
# 登录(ChatGPT 账号或 API key)
codex login
# 交互式
codex
codex "解释 src/auth 下测试为什么挂"
# 非交互(CI / 脚本)
codex exec "为 payment 模块补单测到 90% 覆盖率"
codex exec –json –ephemeral "lint 并修复所有 ts 错误" > out.json
# 模型与权限
codex –model gpt-5.4-mini "重构 auth 模块"
codex –ask-for-approval on-request –sandbox workspace-write "…"
# 子代理 / 会话
/agent # 切线程
/model gpt-5.4 # 运行中换模型
/approvals # 改审批策略
审批三档(CLI):
-
suggest:每步问
-
auto-edit:改文件自动,跑 shell 前问
-
full-auto / –yolo:全自治(只在沙箱 VM 用)
6. 基准表现与怎么读这些数字
-
SWE-bench Verified:codex-1 首发 72.1%(单次)/ 83.8%(8 采样);GPT-5.1-Codex-Max ~77.9%;GPT-5.3-Codex 官方/第三方口径 >82%。
-
Terminal-Bench 2.0:5.1-Codex-Max ~79.9%,说明不只改代码,还能在终端多步操作。
-
注意:SWE-bench 是"给定 issue + repo 快照,能否出通过测试的 patch",不等于生产复杂架构决策能力。它衡量的是"闭环修 issue"的可靠性。
METR 的长任务半衰期研究:前沿 agent 能稳定完成的事任务时长约每 7 个月翻倍——Codex 的长跑实验(25h/13M token)是这个趋势的注脚。
7. 安全、治理与企业部署
OpenAI 自用 Codex 的姿势(也是给企业客户的参考架构):
-
沙箱定边界:写哪里、能否上网、哪些路径保护
-
审批分层:低风险无感过,高风险断点等人
-
Auto-review 子代理:低危自动批,高危按授权级别批
-
网络白名单:只允许 npm/pypi/github 等已知目的,陌生域名要批
-
凭证隔离:MCP/OAuth 存 OS keyring,强制走企业 ChatGPT 空间
-
遥测:OpenTelemetry 导出 prompt/审批/工具调用/MCP/网络代理事件,接 Compliance Logs
对企业来说,Codex 不是"放权给 AI 合并代码",而是"在边界内放权,在边界外强制人工"。
8. 定价与选型(2026 口径)
Codex 不单独卖,绑 ChatGPT 套餐 + API 按 token:
|
Plus |
$20/mo |
有限配额,轻任务,串行 |
学生/偶尔用 |
|
Pro |
$200/mo |
高配额、并行、长任务、优先算力 |
全职开发者 |
|
Team/Business/Enterprise |
按席位+API |
团队隔离、合规日志、automations |
研发团队 |
API 侧(Responses API):
-
gpt-5-codex:1.25/10 每 M 输入/输出
-
gpt-5.3/5.4-codex:更贵,长任务 10M token 级消耗可观
-
prompt caching:重复输入 token 最高 90% 折扣
成本真相:跑一个 25h 实验烧 13M token,按 5.3-Codex 价位就是几百刀一次;但相对初级工程师月薪 $5k–8k 做同样明确定义任务,边际成本仍低。Codex 省钱的前提是:任务边界清晰、测试可验证、人工只做 review。
9. 它不能做什么(别神话)
-
不能替代架构师拍板"该不该做这个功能"
-
不能自主 merge PR(要人点)
-
对无测试/构建脚本坏掉/AGENTS.md 缺失的仓库,表现迅速劣化
-
非标准 monorepo、强依赖内部未授权服务、需要人工点网页的操作,它搞不定
-
长任务会放大"早期方向错了全白跑"的风险——所以要用 worktree + 阶段校验
-
安全上:模型本身被 OpenAI 按"网络安全 High capability 预防"处理,不代表你可以给它生产库直连权限
10. Codex vs Cursor vs Claude Code vs Copilot
-
Codex:异步、云端沙箱、并行多任务、PR 导向;适合"派活儿下班收 diff"
-
Cursor:IDE 内实时、上下文贴近光标、适合"边想边写"
-
Claude Code:本地终端 agent,长上下文对话强,偏交互式结对
-
Copilot:补全+聊天成熟,agent 模式后来跟进,但 Codex 的云端隔离并行是其差异点
选 Codex 的三个信号:
任务能写成"验收标准+测试"
你想一次派 3 个活然后去开会
仓库测试绿不绿是客观真理
11. 一个最小落地路径(团队引入 Codex 的 30 天)
-
Week 1:挑 2 个有单测的服务,写 AGENTS.md,用 Cloud 跑"补单测""修 lint"
-
Week 2:CLI 接本地,开 auto-edit,只许改 src/ 和 test/
-
Week 3:Automations 接 GitHub Issue 标签 codex-triage,自动出 PR 给人 review
-
Week 4:跑一次 2h+ 长任务(如依赖升级),用 worktree + 阶段 commit 控风险
-
红线:生产分支禁直推、敏感凭证不进沙箱、所有 Codex PR 必须过原有 CI + 人工
12. 结语:Codex 代表的范式转移
Codex 的意义不是"AI 写代码更快",而是把软件工程劳动拆成了"人类定义验收标准 + Agent 在沙箱里迭代闭环 + 人类做最终授信"。它把原本只能同步盯着的光标补全,升级成可以睡前派发、醒来收 PR 的异步工厂。
2021 年的 Codex 回答了"自然语言能不能变代码";
2025–2026 年的 Codex 回答的是"自然语言能不能变成一个会跑测试、会开分支、会等你审阅的同事"。
前者是功能,后者是岗位。



