For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航
2026年2月23日 Codex

在 Codex 中运行长时任务

作者: Derrick Choi

在 Codex 中运行长时任务

2025 年 9 月,OpenAI 推出了 GPT-5-Codex,这是首个针对智能体编程优化的 GPT-5 版本。2025 年 12 月,我们发布了 5.2,人们也从那时开始相信,自主编程智能体可以可靠地工作。尤其明显的是,模型能够可靠遵循指令的持续时间大幅增加了。

我想通过压力测试探一探这个极限。于是,我给了 Codex 一个空白代码仓库、完全访问权限,以及一项任务:从零构建一款设计工具。然后,我让它使用 GPT-5.3-Codex,以“极高”推理级别运行。Codex 不间断运行了约 25 小时,使用了约 1300 万个 Token,生成了约 3 万行代码。

这是一次实验,并非生产环境上线。不过,在长时工作中至关重要的几个方面,它表现不错:遵循规格说明、专注于任务、执行验证,并在过程中修复问题。

Codex Design Desk 用户界面

长时间运行的 Codex 会话是什么样的

我让 Codex 根据会话数据生成一个汇总页面:

Codex 会话汇总仪表板

下面展示了 CLI 会话统计数据和 Token 用量:

Codex CLI 会话统计数据和 Token 用量

这些截图直观地展现了一个核心变化:智能体编程越来越看重任务的时间跨度,而不只是单样本任务中的智能表现。

真正的变化在于时间跨度

这不只是“模型变聪明了”。实际变化在于,智能体能够更长时间地保持思路连贯,端到端完成更大规模的工作,并在出错后恢复,而不丢失工作主线。

METR 对时间跨度基准测试的研究,为理解这一趋势提供了一个有用的视角:前沿智能体能够以约 50% 和 80% 的可靠性完成的软件任务,其时长正在迅速增长,大约每 7 个月翻一番。请参阅衡量 AI 完成长时任务的能力(METR)

METR 衡量 AI 完成长时任务能力的图表

我们近期的 GPT-5.3-Codex 发布公告介绍了智能体工作在两个实际方面的进一步提升:

  1. 它更擅长多步骤执行(规划 → 实现 → 验证 → 修复)。
  2. 在运行过程中更容易调整方向,无需重新开始整个运行过程(修正方向不会清除已有进度)。

Cursor 关于长时间运行的自主编程系统的文章也给了我启发,其中包括他们构建浏览器的实验:Cursor 如何构建网页浏览器(扩展智能体规模)

Cursor 团队写道,OpenAI 模型“在长时间自主工作方面要出色得多:遵循指令、保持专注、避免偏离目标,以及准确、完整地实现功能”。

为什么 Codex 能在长时任务中保持思路连贯

长时间运行的工作,与其说依赖一条庞大的提示,不如说更依赖模型所处的智能体循环。

在 Codex 中,这个循环大致如下:

  1. 制定计划
  2. 编辑代码
  3. 运行工具(测试、构建、代码检查)
  4. 观察结果
  5. 修复问题
  6. 更新文档和状态
  7. 重复循环

这个循环之所以重要,是因为它为智能体提供了:

  • 真实反馈(错误、差异、日志)
  • 保存在外部的状态(代码仓库、文件、文档、工作树、输出)
  • 持续接受引导的能力(您可以根据结果修正方向)

这也解释了为什么在 Codex 的各个产品界面中使用 Codex 模型,会比在通用聊天窗口中体验更好:执行框架提供了结构化上下文(代码仓库元数据、文件树、差异、命令输出),并强制遵循严格的完成条件检查流程。

我们最近发布了一篇介绍 Codex 智能体循环的文章,其中有更详细的说明。

此外,我们还推出了 Codex App,让这个循环能够融入日常工作:

显示项目对话线程的 Codex App 工作空间

我的测试设置

我为这次“实验”选择了设计工具,因为这是一项严苛的测试:用户界面、数据模型、编辑操作,以及大量边界情况。糊弄是过不了关的。如果架构有问题,工具很快就会出故障。

我给 GPT-5.3-Codex 提供了一份内容详实的规格说明,让它以“极高”推理级别运行。最终,它不间断运行了约 25 小时,能够保持思路连贯,并交付高质量代码。模型每完成一个里程碑,还会执行验证步骤(测试、代码检查、类型检查)。

核心思路:持久保存项目记忆

最重要的方法是持久保存项目记忆。我把规格说明、计划、约束和状态写进 Markdown 文件,让 Codex 可以反复查阅。这避免了偏离目标,也让“完成”的定义保持稳定。

下方提供了代码仓库链接,使用的文件如下:

Prompt.md(规格说明 + 交付成果)

用途:固定目标,避免智能体“做出令人惊艳却不符合要求的东西”。

文件中的主要部分:

  • 目标 + 非目标
  • 硬性约束(性能、确定性、用户体验、平台)
  • 交付成果(完成时必须具备的内容)
  • “完成条件”(检查项 + 演示流程)

初始提示要求 Codex 将提示/规格文件视为完整的项目规格说明,并生成一份按里程碑组织的计划:

用于启动 Codex 运行的提示

Plan.md(里程碑 + 验证)

用途:将开放式工作拆解为一系列智能体能够完成并验证的检查点。

文件中的主要部分:

  • 足够小、能在一次循环中完成的里程碑
  • 每个里程碑的验收标准 + 验证命令
  • 暂停并修复的规则:如果验证失败,先修复,再继续
  • 记录决策,避免反复摇摆
  • 代码库的预期架构

Codex 在工作时查阅计划 Markdown 文件

我们最近为 Codex App、CLI 和 IDE 扩展添加了原生计划模式。它可以在动手修改之前,将较大的任务拆解成一系列清晰、可审查的步骤,让您提前确认实施方案。如果还需要澄清细节,Codex 会继续提问。使用 /plan 斜杠命令即可开启。

Implement.md(参照计划的执行指令)

用途:这是一份操作手册,明确告诉 Codex 如何开展工作:遵循计划、控制改动范围、运行验证、更新文档。

文件中的主要部分:

  • 以计划 Markdown 文件为准,逐个完成里程碑
  • 每完成一个里程碑就运行验证,发现问题立即修复
  • 将改动限定在既定范围内,不扩大范围
  • 持续更新文档 Markdown 文件

要求 Codex 阅读 implement.md 并将其作为执行指令的提示

Documentation.md(交付过程中的状态与决策)

用途:这份文件兼具共享记忆和审计日志的作用,让我即使离开几个小时,回来后仍能了解期间发生了什么。

文件中的主要部分:

  • 当前里程碑状态(已完成什么,接下来做什么)
  • 已做出的决策及其原因
  • 运行与演示方法(命令和快速冒烟测试)
  • 已知问题与后续事项

展示里程碑状态更新的文档文件

在这次运行中,里程碑验证的实际情况如下:

Codex 在各个里程碑执行的质量验证命令

每个里程碑都进行验证

Codex 并不是写完代码就寄希望于它能正常运行。每完成一个里程碑,它都会执行验证命令,修复问题后再继续。

以下是指令中要求它使用的部分质量检查命令:

用于代码规范检查、类型检查、测试、构建和导出的质量检查命令

下面是 Codex 在代码规范检查失败后修复问题的示例:

Codex 在执行 npm run lint 后修复问题

智能体构建了什么

结果并不完美,也尚未达到生产环境要求,但它是实实在在、可以测试的成果。这次运行的衡量标准不是“能否编译通过”,而是“是否遵循了指令,以及是否真的能用”。

已实现的主要功能:

  1. 画布编辑(画框、分组、形状、文本、图片与图标、按钮、图表)
  2. 实时协作(在线状态、光标、选区和编辑操作在标签页之间同步)
  3. 检查器控件(几何属性、样式、文本)
  4. 图层管理(搜索、重命名、锁定与隐藏、调整顺序)
  5. 参考线、对齐与吸附
  6. 历史快照与恢复
  7. 回放时间线,并从先前的时间点创建分支
  8. 原型模式(交互热区与流程导航)
  9. 评论(固定位置的讨论串,可标记为已解决或重新打开)
  10. 导出(保存、导入、导出,以及通过 CLI 导出为 JSON 和 React + Tailwind)

在 Codex 中运行长时任务的经验

这次运行能够成功,靠的不是某一条巧妙的提示,而是以下因素的共同作用:

  • 明确的目标与约束(规格文件)
  • 设有检查点和验收标准的里程碑(plans.md
  • 指导智能体如何工作的操作手册(implement.md
  • 持续验证(测试、代码规范检查、类型检查、构建)
  • 实时更新的状态记录与审计日志(documentation.md),让运行过程始终可供查看

这就是长时编程任务的发展方向:减少事事盯守,在护栏保障下委派更多工作。

让 Codex 试试您自己的长时间运行任务

这次持续 25 小时的 Codex 运行,让我们提前看到了编程开发的未来。我们正在从单次提示和紧密的结对编程循环,走向与能够持续工作的队友协作:它可以从头到尾完成一整块实际工作,而您只需在里程碑处把握方向,无须逐行管理代码。

我们对 Codex 的发展方向很明确:让它更善于像队友一样协作,更紧密地融入您的实际上下文,并通过护栏让工作成果可靠、可审查、易于交付。我们已经看到,当智能体承担常规的实现和验证工作后,开发者的推进速度会更快,也能腾出精力专注于最重要的部分:设计、架构、产品决策,以及没有现成模板可循的新问题。

受益者也不会止于开发者。随着 Codex 越来越善于理解意图,并提供安全的配套机制(计划、验证、预览、回滚),更多非开发者也能构建和迭代产品,而无须整天待在 IDE 中。Codex 的各个使用界面和模型还会持续更新,但核心目标始终不变:让智能体不再像一个需要您时刻盯着的工具,而更像一位能让您放心托付长时任务的队友。

如果您也想亲自尝试,可以从以下资源入手: