Codex:Apache-2.0 开源内核,一个 agent 四种形态,并且是 OpenAI 系模型的参照 harness
openai-codex
OpenAI 的编码 agent,2026 年的形态不是一个产品而是同一套内核的四个入口:CLI(本地终端)、IDE 扩展(官方点名 VS Code / Cursor / Windsurf)、桌面应用(codex app 一条命令拉起)与 Codex Web(chatgpt.com/codex 上任务托管在远端跑)。仓库 openai/codex 是 Apache-2.0,2026-09-28 抓取 126,918 stars / 19,819 forks——少数把 harness 本身开源的前沿方案,上下文怎么组织、工具怎么排、审批怎么卡都能读到。安全模型是一等公民:docs/ 里 sandbox.md、execpolicy.md、exec.md、agents_md.md、skills.md、slash_commands.md 构成一张能力地图;execpolicy 把「哪些命令可直接执行、哪些必须问」写成可审计、可版本化、可在组织内统一分发的策略而不是靠模型自觉,exec 让它能进 CI、进脚本、进批处理,而不只是坐在终端里等人;AGENTS.md 已经事实上成为跨工具标准。安装四通道(install.sh / install.ps1 / npm / brew),鉴权两口径:ChatGPT 套餐内含用量 vs API Key 按 token 计费,团队选型先算这笔账。它同时是行业默认的「OpenAI 系模型参照 harness」——Cursor 的 Terminal-Bench 2.0 脚注明写 OpenAI 模型分数用 Simple Codex harness,官方公布的 Terminal-Bench 4.0 读数 58.18% 已记在 GPT-6 Astra 卡上(衡量的是模型不是外壳),本条目不重复占用。边界:模型闭源、数据出域不可绕过;developers.openai.com 对自动化抓取返回 403,事实层以仓库 README/docs 与 GitHub API 为准。卡片指标只取可核验的事实层(许可 + stars)。置信度 C(厂商宣称)。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- Harness 内核许可 + GitHub stars
- 厂商宣称 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断我们给它 C 档(厂商宣称)。Terminal-Bench 4.0 由 Stanford / Harbor / Laude Institute 托管,是可信的第三方基准,但 58.18% 这个读数是厂商侧发布、我们未复算;同时
developers.openai.com对自动抓取返回 403,细节能力面只能从开源仓库反推。可确认的部分是硬的:Apache-2.0 许可、126,918 stars、四条安装通道、docs 目录里的 sandbox / execpolicy / exec / skills / AGENTS.md 概念,以及 Cursor 官方脚注承认它是 OpenAI 系模型的对照 harness。水位判断:Codex 的战略位置不在「又一个 CLI」,而在两件事。第一,它把 harness 开源了,这让它的沙箱与执行策略成了行业可读的参考实现;第二,它被竞争对手拿去做基准对照,等于同行默认它代表 OpenAI 模型的真实上限。对团队而言,四个入口共用一个内核意味着本地开发、IDE、桌面与云端托管可以共享同一份 AGENTS.md 与策略,迁移成本远低于换供应商。
要如实说清的代价:模型闭源、数据出域、两种计费口径容易混算。
它是什么:一个 Apache-2.0 的编码 agent,同时是四种形态
Codex 是 OpenAI 的编码 agent。它在 2026 年的形态不是一个产品,而是同一套 agent 的四个入口:Codex CLI(本地终端里跑,仓库自述为「a lightweight coding agent that runs in your terminal」)、IDE 扩展(官方点名 VS Code、Cursor、Windsurf 三家)、桌面应用(codex app 一条命令拉起)、以及 Codex Web(chatgpt.com/codex 上的云端 agent,任务托管在远端跑)。四个入口共用同一个内核,这也是它与「只做一个插件」的产品的根本区别。
仓库 openai/codex 是 Apache-2.0 许可,2026-09-28 抓取时 126,918 stars / 19,819 forks。这一点很重要:它是当前少数「harness 本身开源」的前沿厂商方案,任何人都能读它怎么组织上下文、怎么排工具、怎么做审批。
安装与鉴权:四条安装通道,两种付费口径
安装通道覆盖得相当完整:macOS/Linux 一行 curl -fsSL https://chatgpt.com/codex/install.sh | sh;Windows 一行 irm https://chatgpt.com/codex/install.ps1 | iex;也可以走 npm install -g @openai/codex 或 brew install --cask codex。独立安装包默认从 releases.openai.com/codex 下载,元数据或资产不可用时回落 GitHub Releases,并提供 CODEX_INSTALLER_USE_RELEASES_OPENAI_COM=false 强制走 GitHub——把「分发源故障」当成一个要显式处理的工程问题,这种细节通常只在被真实规模打过之后才会出现。
鉴权是两条口径:官方推荐 Sign in with ChatGPT,把 Codex 作为 Plus / Pro / Business / Edu / Enterprise 套餐的一部分使用;也可以用 API Key,但需要额外配置。前者是订阅制包含用量,后者是按 token 计费——同一套 agent,两种完全不同的成本模型,团队选型时要先算这一笔。
安全模型是一等公民:sandbox、approvals、execpolicy
看一个 agent harness 的成熟度,最快的方法是看它的文档目录里有哪些名词。openai/codex 的 docs/ 里有:sandbox.md(沙箱与审批)、execpolicy.md(执行策略)、exec.md(非交互执行)、config.md 与 example-config.md(配置)、agents_md.md(AGENTS.md)、skills.md(技能)、slash_commands.md(斜杠命令)、authentication.md(鉴权)、install.md、open-source-fund.md(开源基金)。这份目录本身就是一张能力地图:
- sandbox + approvals:文件系统与网络的隔离边界,以及越界前的人工审批。这是「敢不敢让 agent 在有真实凭据的机器上跑」的前提。
- execpolicy:把「哪些命令可以直接执行、哪些必须问」写成策略而不是靠模型自觉。策略化的意义在于可审计、可版本化、可在组织内统一分发。
- exec:非交互执行入口,意味着 Codex 可以进 CI、进脚本、进批处理,而不只是坐在终端里等人。
- AGENTS.md:仓库级的 agent 说明书。这个文件已经事实上成为跨工具标准——不止 Codex 读它。
- skills / slash commands:可复用的能力封装与快捷入口,是把「个人提示词」沉淀成「团队资产」的那一层。
为什么它在评测里是一个「参照 harness」
Terminal-Bench 4.0 由 Stanford / Harbor / Laude Institute 托管,是 2026 年衡量 agent 长程终端工作的主力基准之一。第三方在公布跨厂商对比时,必须固定 harness 才可比:Cursor 在 Composer 2 的官方评测脚注里明确写了——Anthropic 模型的分数使用 Claude Code harness,OpenAI 模型的分数使用 Simple Codex harness,而 Cursor 自己走 Terminal-Bench 2.0 官方指定的 Harbor 框架、每组合 5 轮取均值。
这句话的信息量在于:Codex 已经被同行当成「OpenAI 系模型的标准外壳」。在编码 agent 领域,harness 与模型是乘数关系而不是加法关系——同一个模型换个壳,长任务完成率能差十几个点。一个被竞争对手拿来做基准对照的 harness,等于行业默认它代表了这家模型的真实上限。
与本站已收录的 GPT-6 Astra 配合时,官方公布的 Terminal-Bench 4.0 读数为 58.18%(榜单第一)。该读数由厂商侧发布,我们未独立复算,且同一个数字已经记在 GPT-6 Astra 那张卡上(它衡量的是模型,不是外壳),所以本条目不把它当作自己的指标,置信度按厂商宣称(C 档)标注;卡片指标只取可核验的事实层:内核许可与仓库 stars。
边界
内核 Apache-2.0 开源,但模型闭源、只能走 OpenAI 侧服务,数据出域不可绕过;ChatGPT 套餐内的用量口径与 API Key 计费口径差异很大,混用会让成本核算失真;developers.openai.com 对自动化抓取返回 403,本条目的事实层以 GitHub 仓库 README/docs 目录、GitHub API 元数据与第三方评测脚注为准。