欢迎光临
我们一直在努力

第一篇:《Codex 是什么?从代码补全到通用 AI 智能体的演进》

如果你对 Codex 的印象还停留在“GitHub Copilot 背后的代码补全模型”,那么你需要重新认识它。2026 年的 Codex,已经从一个代码生成模型演变为一个覆盖 CLI、桌面应用、IDE 插件、Web 端和 API/SDK 的通用 AI 智能体平台。它不再只是帮你补全一行代码——它能够自主读取项目、执行命令、运行测试、提交 PR,甚至在你睡觉时持续处理长期任务。本文从 Codex 的演进历史讲起,深入剖析其核心定位与能力边界,帮你建立对 Codex 的完整认知。

一、Codex 的“前世今生”:一次彻底的自我重塑
要理解今天的 Codex,必须先厘清一个常见的混淆:2021 年的 Codex 和 2026 年的 Codex 是两个不同的产品。

2021 年发布的 Codex 是一个代码生成语言模型,作为 GPT-3 的代码微调版本,它曾是 GitHub Copilot 的早期底层模型。 但这个原始版本后来被停用,逐渐淡出了公众视野。

2025 年,OpenAI 以一种完全不同的方式让 Codex “复活”。2025 年 4 月,OpenAI 发布了 Codex CLI——一个面向终端环境的智能代理工具,允许开发者通过自然语言指令与代码库交互,执行代码修改、解释和调试等任务。 2025 年 5 月 16 日,Codex 以“云端软件工程代理”的研究预览形式进入 ChatGPT,可并行处理多个任务,每个任务运行在独立的云端沙盒环境中。

从这一刻起,Codex 的定位发生了根本性转变:它不再是一个“模型”,而是一个“代理”。

二、2026 年的 Codex:不只是编码,而是“几乎无所不能”
2026 年 4 月 16 日,OpenAI 发布了名为 “Codex for (Almost) Everything” 的重大更新,标志着 Codex 从开发者工具向通用智能体超级应用的跨越。 这次更新的核心变化可以概括为四个维度:

第一,从“写代码”扩展到“操作电脑”。

Codex 现在可以通过背景电脑操作功能,用自己的游标查看、点击和输入,直接操作你电脑上的各种应用程序。多个智能体可以在你的 Mac 上并行工作,而不会干扰你在其他应用中的操作。 这对反覆调整前端变更、测试应用程序,或处理未提供 API 的应用程序特别有用。

第二,从“单次对话”扩展到“长期任务”。

Codex 现在可以为自己安排后续工作,并在适当时机自动唤醒,继续处理长期任务——甚至可跨越数天或数周。 团队使用自动化程序处理从完成未合并的 Pull Request,到跟进 Slack、Gmail 和 Notion 中快速变化的对话。

第三,从“无状态”扩展到“有记忆”。

OpenAI 推出了记忆功能的预览版,让 Codex 能记住过往经验中的实用上下文,包括个人偏好、修正内容,以及需要花时间整理的资讯。这有助于后续任务更快完成,并达到以往只有透过大量自订指令才能实现的品质水平。

第四,从“少量插件”扩展到“90+ 插件生态”。

Codex 推出了超过 90 个新插件,整合了技能、应用程序与 MCP 服务器,让 Codex 能以更多方式收集上下文,并跨工具执行操作。 其中包括 Atlassian Rovo(管理 JIRA)、CircleCI、CodeRabbit、GitLab Issues、Microsoft Suite、Remotion、Render 等。

三、Codex 的五种接入形态
Codex 不是一个单一的应用,而是一个覆盖多种使用场景的平台:

形态定位适用场景
CLI终端智能代理开发者在终端中委托任务
桌面应用代理指挥中心同时管理多个并行智能体
IDE 插件VS Code 集成在编辑器中无缝使用
Web 端浏览器中的工程任务设计→开发→PR 全流程
API/SDK程序化控制自动化流水线、CI/CD 集成

2026 年 2 月,OpenAI 正式推出 Codex 独立 macOS 桌面应用,将其定位为 “代理指挥中心” ,旨在管理多个并行运行的 AI 编码代理。 5 月,Codex 进一步扩展到移动端,并宣布 Remote SSH 支持正式可用,允许 Codex 直接连接到受管企业环境和远程机器。

四、Codex 的底层模型:GPT-5-Codex
Codex 的能力建立在 GPT-5-Codex 模型之上。这个模型针对软件工程任务和安全进行了专门训练,在恶意任务和提示注入防护方面有专项优化。

在基准测试中,Codex CLI 在 SWE-bench Verified 上得分 77.3%,在 Terminal-Bench 2.0 上的表现同样处于第一梯队。 在更广泛的 PR 接受率评测中,Codex 在 9 类任务中实现了 59.6% 至 88.6% 的接受率,其中文档类任务达到 82.1%。

不过,Codex 也有明确的能力边界。在测试类任务中,其接受率仅为 59.6%,是九类任务中最低的。 这说明:Codex 在“写代码”上很强,但在“验证代码”上仍然需要人类把关。

五、Codex 的核心理念:从“辅助输入”到“自主做事”
Codex 与传统代码补全工具最根本的区别,在于工作模式的转变:

传统模式:你写代码 → 工具补全 → 你继续写。你是主导者,工具是辅助者。

Codex 模式:你描述任务 → Codex 自主规划 → Codex 执行并验证 → 你审查结果。你是委托者,Codex 是执行者。

这种转变的核心载体是 Agent Loop(智能代理循环) ——Codex 获取用户输入、将其整合到为模型准备的提示词中、查询模型、执行工具调用、将输出附加到原始提示词、再次查询模型……如此循环,直至任务完成。

Agent Loop 的详细机制,我们将在第三篇文章中深入展开。现在你只需要理解一点:Codex 不是“更聪明的自动补全”,而是一个能够自主规划和执行多步骤任务的智能体。

六、小结
Codex 的演进:从 2021 年的代码生成模型,到 2025 年以 CLI 和云端代理形式重生,再到 2026 年成为覆盖五种形态的通用智能体平台。

2026 年重大更新:背景电脑操作、长期任务自动化、记忆功能、90+ 插件生态。

五种接入形态:CLI、桌面应用、IDE 插件、Web 端、API/SDK。

底层模型:GPT-5-Codex,SWE-bench 得分 77.3%,PR 接受率 59.6%-88.6%。

核心理念:从“辅助输入”转向“自主做事”,Agent Loop 是其核心运行逻辑。

赞(0)
未经允许不得转载:171主机测评 » 第一篇:《Codex 是什么?从代码补全到通用 AI 智能体的演进》
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址