欢迎光临
我们一直在努力

OpenAI Codex 全景详解:从“代码补全引擎“到“云端软件工程智能体平台“

适用读者:后端/全栈工程师、平台工程负责人、CTO、AI 工具选型者、对 AI 编程代理感兴趣的研究者。

0. 一句话定位(2026 版)

OpenAI Codex 已经不是"一个模型",而是一套由 Codex 系列模型 + 云端隔离沙箱 + 本地 CLI/IDE/桌面端组成的软件工程智能体(Software Engineering Agent)平台。​ 它能在隔离环境里读仓库、改多文件、跑测试、修报错、开 PR,并把过程日志交给你审;你给它一个任务,可以去喝咖啡,回来收一个可 review 的 diff。


1. 两次生命:Codex 是怎么从 Copilot 的"发动机"变成 Agent 的

1.1 第一世:2021 年的 Codex(补全模型)

  • 本质:基于 GPT-3 微调的代码生成模型,API 名如 code-davinci-002。

  • 能力边界:注释/函数名 → 补全下一行或下一个函数;单文件、无执行、不知测试能否通过。

  • 历史角色:它是 GitHub Copilot 第一代补全能力的供血引擎,定义了"AI 写代码"的第一波认知。

  • 结局:2023 年 3 月 OpenAI 弃用原 Codex API,Copilot 切到 GPT-4 系;但"Codex"这个名字被保留下来。

1.2 第二世:2025–2026 的 Codex(Agent 平台)

维度

老 Codex(2021)

新 Codex(2025–2026)

形态

补全模型 API

云端/本地软件工程 Agent 平台

驱动

GPT-3 监督微调

codex-1(o3 系 RL)→ GPT-5-Codex 系

工作流

输入→输出,一次性

规划→编辑→跑工具→观察→修复→再跑

环境

无,纯生成

隔离 Linux 沙箱 / 本地沙箱,能 npm install、跑 pytest、开分支

交付物

代码片段

PR / feature 分支 / 修复补丁 / 架构说明

交互

同步补全

异步并行 + 人工审批 + 日志溯源

关键转折:

  • 2025-04-16​ Codex CLI 开源(Rust 写,Apache-2.0)。

  • 2025-05-16​ Codex Cloud 以研究预览进 ChatGPT(Pro/Team/Enterprise 先用,6 月铺到 Plus),底层 codex-1(o3 针对 SWE 的 RL 微调)。

  • 2025-09​ GPT-5-Codex 成为云端默认,引入 Skills / Automations。

  • 2026 上半年​ 桌面 App、Codex Security、子代理(subagents)、GPT-5.3/5.4-Codex 相继落地。

结论:今天你说"Codex",指的是智能体系统,不是那个 2021 年的模型。


2. 架构总览:四层堆叠

┌──────────────────────────────────────────────┐
│ 接入层:ChatGPT 侧边栏 / codex.chatgpt.com │
│ Codex CLI / Desktop App / VS Code 插件 │
├──────────────────────────────────────────────┤
│ 编排层:Agent Loop + Subagents + Skills │
│ approval policy / sandbox policy │
├──────────────────────────────────────────────┤
│ 执行层:隔离沙箱(云端容器 / 本地 seccomp) │
│ git · shell · 测试·lint·typecheck·docker│
├──────────────────────────────────────────────┤
│ 模型层:codex-1 → GPT-5-Codex → 5.3/5.4-Codex │
└──────────────────────────────────────────────┘

2.1 模型层:codex-1 与 GPT-5-Codex 家族

  • codex-1:OpenAI o3 的软件工程特化版,用真实仓库任务做 RL,目标是对齐"人类 PR 风格 + 指令遵循 + 跑通测试"。官方披露 SWE-bench Verified:单次 72.1%,8 次采样 83.8%。

  • GPT-5-Codex(2025-09):GPT-5 的 agentic coding 特化,支持动态 reasoning effort(秒级到数小时任务)。

  • GPT-5.1-Codex-Max(2025-11):引入上下文 compaction,支持跨窗口长程一致;适应 Windows。

  • GPT-5.2 / 5.3-Codex(2025-12~2026-02):长程指令遵循跃迁,官方实验中 5.3-Codex 以 Extra High 推理连跑 25 小时、~13M token、~30k 行代码​ 造出一个设计工具原型。

  • GPT-5.4 / 5.4-mini / 5.3-Codex-Spark(2026 中):5.4 为综合旗舰默认;mini 做低延迟子代理;Spark 做近实时交互。

2.2 执行层:沙箱是 Codex 的命门

云端每个任务 = 一个独立容器:

  • 预装你的 repo(GitHub OAuth 授权拉取)

  • 默认禁外网,后可按团队策略开白名单(npm/pypi 等)

  • 文件系统只写 workspace,宿主机不可见

  • 网络/路径/命令受 sandbox policy 约束

本地 CLI 三种 sandbox_mode:

  • read-only:只读

  • workspace-write:改项目目录

  • danger-full-access:放开(仅建议在隔离 VM 里用 –yolo)

2.3 编排层:Agent Loop

标准循环(这也是它比聊天补全强的地方):

  • 解析任务与 AGENTS.md / 项目文档

  • 规划(plan)

  • 编辑代码(edit)

  • 调用工具(test / build / lint / git diff)

  • 观察输出(logs / failures)

  • 修复(repair)→ 回到 3

  • 提交分支、出 PR、写总结

  • 外部化状态(repo、diff、worktree、markdown 状态文件)让模型不靠上下文硬撑,而是靠环境反馈闭环。

    2.4 接入层:四端一体

    • Codex Cloud(chatgpt.com/codex):异步大任务、并行多任务、不占本地资源

    • Codex CLI(Rust,开源):终端原住民,codex "…" 或 codex exec

    • Codex Desktop App:可视化指挥台、多项目并行、后台 automation、跨会话记忆

    • IDE 扩展(VS Code / Cursor / JetBrains):inline / chat / agent 三模式

    四端共用同一 ChatGPT 账号、同一份 AGENTS.md 与配置层。


    3. 核心能力拆解(不只是"写代码")

    3.1 端到端任务执行

    "加一个功能"不是生成片段,而是:建分支 → 改 N 文件 → 补测试 → 跑通 CI → 推 PR → 写变更说明。

    3.2 异步并行多任务

    云端可同时派:

    • Task A:给 payment 模块补单测到 90%

    • Task B:把所有 API 端点加 input validation

    • Task C:从 router 生成 OpenAPI 文档

      三个沙箱互不阻塞。

    3.3 代码库问答(Ask 模式)

    只读分析架构、依赖、某次回归是谁引入的、这个 module 为什么这样写。

    3.4 自主修 Bug 与测试驱动

    以"测试通过"为完成信号。无测试的项目会退化成"看起来合理但不可验证"——这是使用 Codex 的前提:仓库要有可跑的测试。

    3.5 长程任务(Long-horizon)

    借助 markdown 持久记忆(spec/plan/status)、git worktree 隔离、reasoning effort 调节,跑数小时到二十几小时不漂移。

    3.6 Subagents(2026 能力)

    内置 default / worker / explorer,也可在 ~/.codex/agents/*.toml 定义自定义代理;对"按点审查 PR"可一拖 N 子代理并行,父代理汇总。代价是 token 消耗倍增。

    3.7 Skills 与 Automations

    • Skills:可复用的指令+脚本包(如"做国际化抽取"、"按公司 ESLint 规则修全仓")

    • Automations:监听 GitHub Issue / CI 失败 / 定时任务,后台触发 Codex 处理

    3.8 Codex Security(2026-03)

    专用安全变体,自动发现/修漏洞;OpenAI 称测试期在 Chromium/OpenSSL 等扫到近 800 严重 + 上万高危问题。


    4. 提示词与仓库工程化:AGENTS.md 是关键

    Codex 不吃"玄学 prompt",吃工程上下文。推荐在仓库根放:

    # AGENTS.md
    – 安装:pnpm i
    – 测试:pnpm test(单元) / pnpm test:e2e
    – lint:pnpm lint && pnpm typecheck
    – 分支策略:每条任务开 feat/codex-* 分支
    – 禁止:不要改 schema 迁移以外的 migration 文件
    – 风格:函数名 camelCase,组件用 PascalCase,注释只写 why
    – 完成标准:test 全绿 + lint 零错 + 补单测

    规则越像"你给 junior 工程师的 onboarding 文档",Codex 越像 senior。

    任务 prompt 推荐四段式:

    • Goal:要变成什么样

    • Context:涉及模块/文件/约束

    • Constraints:不能碰什么、必须兼容什么

    • Done when:测试名、覆盖率、性能阈值

    例:

    /goal 把 Express 的 user router 迁移到 Hono。
    Context: src/routes/user.ts、middleware/auth.ts、test/user.test.ts
    Constraints: 不引入新依赖版本大跳;JWT 逻辑保持不变
    Done when: pnpm test 全绿,pnpm start 起来返回 200,旧 Express 入口删除


    5. CLI 实战速查

    # 安装
    npm i -g @openai/codex
    # 或 brew install codex

    # 登录(ChatGPT 账号或 API key)
    codex login

    # 交互式
    codex
    codex "解释 src/auth 下测试为什么挂"

    # 非交互(CI / 脚本)
    codex exec "为 payment 模块补单测到 90% 覆盖率"
    codex exec –json –ephemeral "lint 并修复所有 ts 错误" > out.json

    # 模型与权限
    codex –model gpt-5.4-mini "重构 auth 模块"
    codex –ask-for-approval on-request –sandbox workspace-write "…"

    # 子代理 / 会话
    /agent # 切线程
    /model gpt-5.4 # 运行中换模型
    /approvals # 改审批策略

    审批三档(CLI):

    • suggest:每步问

    • auto-edit:改文件自动,跑 shell 前问

    • full-auto / –yolo:全自治(只在沙箱 VM 用)


    6. 基准表现与怎么读这些数字

    • SWE-bench Verified:codex-1 首发 72.1%(单次)/ 83.8%(8 采样);GPT-5.1-Codex-Max ~77.9%;GPT-5.3-Codex 官方/第三方口径 >82%。

    • Terminal-Bench 2.0:5.1-Codex-Max ~79.9%,说明不只改代码,还能在终端多步操作。

    • 注意:SWE-bench 是"给定 issue + repo 快照,能否出通过测试的 patch",不等于生产复杂架构决策能力。它衡量的是"闭环修 issue"的可靠性。

    METR 的长任务半衰期研究:前沿 agent 能稳定完成的事任务时长约每 7 个月翻倍——Codex 的长跑实验(25h/13M token)是这个趋势的注脚。


    7. 安全、治理与企业部署

    OpenAI 自用 Codex 的姿势(也是给企业客户的参考架构):

    • 沙箱定边界:写哪里、能否上网、哪些路径保护

    • 审批分层:低风险无感过,高风险断点等人

    • Auto-review 子代理:低危自动批,高危按授权级别批

    • 网络白名单:只允许 npm/pypi/github 等已知目的,陌生域名要批

    • 凭证隔离:MCP/OAuth 存 OS keyring,强制走企业 ChatGPT 空间

    • 遥测:OpenTelemetry 导出 prompt/审批/工具调用/MCP/网络代理事件,接 Compliance Logs

    对企业来说,Codex 不是"放权给 AI 合并代码",而是"在边界内放权,在边界外强制人工"。


    8. 定价与选型(2026 口径)

    Codex 不单独卖,绑 ChatGPT 套餐 + API 按 token:

    档位

    价格

    Codex 权益

    适合

    Plus

    $20/mo

    有限配额,轻任务,串行

    学生/偶尔用

    Pro

    $200/mo

    高配额、并行、长任务、优先算力

    全职开发者

    Team/Business/Enterprise

    按席位+API

    团队隔离、合规日志、automations

    研发团队

    API 侧(Responses API):

    • gpt-5-codex:1.25/10 每 M 输入/输出

    • gpt-5.3/5.4-codex:更贵,长任务 10M token 级消耗可观

    • prompt caching:重复输入 token 最高 90% 折扣

    成本真相:跑一个 25h 实验烧 13M token,按 5.3-Codex 价位就是几百刀一次;但相对初级工程师月薪 $5k–8k 做同样明确定义任务,边际成本仍低。Codex 省钱的前提是:任务边界清晰、测试可验证、人工只做 review。


    9. 它不能做什么(别神话)

    • 不能替代架构师拍板"该不该做这个功能"

    • 不能自主 merge PR(要人点)

    • 对无测试/构建脚本坏掉/AGENTS.md 缺失的仓库,表现迅速劣化

    • 非标准 monorepo、强依赖内部未授权服务、需要人工点网页的操作,它搞不定

    • 长任务会放大"早期方向错了全白跑"的风险——所以要用 worktree + 阶段校验

    • 安全上:模型本身被 OpenAI 按"网络安全 High capability 预防"处理,不代表你可以给它生产库直连权限


    10. Codex vs Cursor vs Claude Code vs Copilot

    • Codex:异步、云端沙箱、并行多任务、PR 导向;适合"派活儿下班收 diff"

    • Cursor:IDE 内实时、上下文贴近光标、适合"边想边写"

    • Claude Code:本地终端 agent,长上下文对话强,偏交互式结对

    • Copilot:补全+聊天成熟,agent 模式后来跟进,但 Codex 的云端隔离并行是其差异点

    选 Codex 的三个信号:

  • 任务能写成"验收标准+测试"

  • 你想一次派 3 个活然后去开会

  • 仓库测试绿不绿是客观真理


  • 11. 一个最小落地路径(团队引入 Codex 的 30 天)

    • Week 1:挑 2 个有单测的服务,写 AGENTS.md,用 Cloud 跑"补单测""修 lint"

    • Week 2:CLI 接本地,开 auto-edit,只许改 src/ 和 test/

    • Week 3:Automations 接 GitHub Issue 标签 codex-triage,自动出 PR 给人 review

    • Week 4:跑一次 2h+ 长任务(如依赖升级),用 worktree + 阶段 commit 控风险

    • 红线:生产分支禁直推、敏感凭证不进沙箱、所有 Codex PR 必须过原有 CI + 人工


    12. 结语:Codex 代表的范式转移

    Codex 的意义不是"AI 写代码更快",而是把软件工程劳动拆成了"人类定义验收标准 + Agent 在沙箱里迭代闭环 + 人类做最终授信"。它把原本只能同步盯着的光标补全,升级成可以睡前派发、醒来收 PR 的异步工厂。

    2021 年的 Codex 回答了"自然语言能不能变代码";

    2025–2026 年的 Codex 回答的是"自然语言能不能变成一个会跑测试、会开分支、会等你审阅的同事"。

    前者是功能,后者是岗位。

    赞(0)
    未经允许不得转载:171主机测评 » OpenAI Codex 全景详解:从“代码补全引擎“到“云端软件工程智能体平台“
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址