2025 年 9 月,OpenAI 推出 GPT-5-Codex,這是首個針對智慧體式程式碼編寫最佳化的 GPT-5 版本。2025 年 12 月,我們推出 5.2,人們也從那時開始相信,自主程式碼編寫智慧體可以可靠地完成工作。尤其明顯的是,模型能可靠遵循指示的持續時間大幅增加。
我想透過壓力測試,看看這個極限在哪裡。於是,我給了 Codex 一個空白程式碼庫、完整存取權,以及一項任務:從零開始打造設計工具。接著,我讓它使用 GPT-5.3-Codex,以「極高」推理等級執行。Codex 連續執行了約 25 小時,使用約 1,300 萬個 Token,並產生約 3 萬行程式碼。
這是一次實驗,並非正式環境上線。不過,在長時間工作的重要環節上,它表現良好:遵循規格、專注於任務、執行驗證,並在過程中修正問題。

長時間執行的 Codex 工作階段是什麼樣子
我請 Codex 根據工作階段資料產生摘要頁面:

以下則是 CLI 工作階段的統計資料與 Token 用量:

這些螢幕擷取畫面讓核心轉變清楚可見:智慧體式程式碼編寫越來越重視任務時間跨度,而不只是單次回應的智慧表現。
真正的轉變在於任務時間跨度
這不只是「模型變聰明了」。實際的改變是,智慧體能在更長的時間內維持連貫性,從頭到尾完成更大範圍的工作,並在發生錯誤後恢復執行,同時不失去原有脈絡。
METR 的任務時間跨度基準測試研究,有助於我們理解這個趨勢:前沿智慧體能以約 50% 和 80% 的可靠度完成的軟體任務,其時間長度正快速增加,大約每 7 個月就翻倍。請參閱衡量 AI 完成長時間任務的能力(METR)。

我們近期的 GPT-5.3-Codex 發布公告,說明了智慧體工作在兩個實用層面的進一步提升:
- 它更擅長執行多步驟流程(規劃 → 實作 → 驗證 → 修正)。
- 執行途中更容易調整方向,無須從頭開始(修正方向不會清除既有進度)。
Cursor 關於長時間執行的自主程式碼編寫系統的文章也啟發了我,其中包括他們打造瀏覽器的實驗:Cursor 如何打造網頁瀏覽器(擴展智慧體規模)。
Cursor 團隊寫道,OpenAI 模型「在長時間自主工作方面表現好得多:遵循指示、保持專注、避免偏離方向,以及精確且完整地實作功能」。
為什麼 Codex 能在長時間任務中維持連貫性
長時間執行的工作,與其仰賴一份龐大的提示詞,更取決於模型運作時所處的智慧體迴圈。
在 Codex 中,這個迴圈大致如下:
- 規劃
- 編輯程式碼
- 執行工具(測試/建置/程式碼靜態檢查)
- 觀察結果
- 修正問題
- 更新文件/狀態
- 重複執行
這個迴圈很重要,因為它為智慧體提供了:
- 實際回饋(錯誤、差異、記錄)
- 儲存在外部的狀態(程式碼庫、檔案、文件、工作樹、輸出)
- 持續調整方向的能力(你可以根據結果修正方向)
這也解釋了為什麼在 Codex 介面中使用 Codex 模型,比在一般聊天視窗中更順手:任務執行框架會提供結構化的上下文(程式碼庫中繼資料、檔案樹、差異、指令輸出),並嚴格要求依照既定流程確認是否符合「完成條件」。
我們最近發布了一篇介紹 Codex 智慧體迴圈的文章,其中有更詳細的說明。
此外,我們也推出了 Codex App,讓這個迴圈能融入日常工作:
- 跨專案平行執行對話串(長時間工作不會耽擱你的日常工作)
- 技能(將規劃/實作/測試/報告流程標準化)
- 自動化(在背景處理例行工作)
- Git 工作樹(隔離各次執行、讓差異易於審查,並減少反覆折騰)

我的測試設定
我選擇設計工具作為這次「實驗」的題目,因為這是個嚴苛的考驗:使用者介面、資料模型、編輯操作,加上大量邊界情況。這種測試無法蒙混過關。架構一旦有問題,很快就會出錯。
我給了 GPT-5.3-Codex 一份內容紮實的規格,並以「極高」推理等級執行。結果,它連續執行了約 25 小時,仍能維持連貫性,交付優質程式碼。模型每完成一個里程碑,也都會執行驗證步驟(測試、程式碼靜態檢查、型別檢查)。
關鍵概念:可持續保留的專案記憶
最重要的技巧,是建立可持續保留的專案記憶。我把規格、計畫、限制條件與狀態寫進 Markdown 檔案,讓 Codex 能反覆查閱。這避免了方向偏移,也讓「完成」的定義保持一致。
下方提供程式碼庫連結,使用的檔案如下:
Prompt.md(規格 + 交付成果)
目的:固定目標,避免智慧體「做出令人驚豔、卻不符合需求的東西」。
檔案中的主要章節:
- 目標 + 不在目標範圍內的事項
- 不可妥協的限制條件(效能、確定性、使用者體驗、平台)
- 交付成果(完成時必須具備的項目)
- 「完成條件」(檢查項目 + 示範流程)
最初的提示詞要求 Codex 將提示詞/規格檔案視為完整的專案規格,並產生以里程碑為基礎的計畫:

Plan.md(里程碑 + 驗證)
目的:把開放式工作拆成一連串檢查點,讓智慧體能逐一完成並驗證。
檔案中的主要章節:
- 將里程碑縮小到能在一次迴圈內完成的規模
- 每個里程碑的驗收標準 + 驗證指令
- 先停下來修正的規則:如果驗證失敗,必須先修正才能繼續
- 記錄決策,避免反覆改變方向
- 程式碼庫的預定架構

我們最近在 Codex App、CLI 和 IDE 擴充功能中加入了原生規劃模式。這個模式能在開始修改前,將較大的任務拆解成一連串清楚、可供審查的步驟,讓你事先確認執行方式。若還有需要釐清的地方,Codex 會進一步提問。若要開啟此模式,請使用 /plan 斜線指令。
Implement.md(參照計畫的執行指示)
用途:這是操作手冊,明確告訴 Codex 該如何執行:遵循計畫、將變更限制在指定範圍內、執行驗證,以及更新文件。
檔案中的主要章節:
- 以 Markdown 計畫檔案為準,逐一完成里程碑
- 每完成一個里程碑就執行驗證(發現問題立即修正)
- 將變更限制在指定範圍內(不要擴大範圍)
- 持續更新 Markdown 文件檔案

Documentation.md(交付過程中的狀態與決策)
用途:這是共用記憶與稽核紀錄。有了它,即使我離開數小時,回來後仍能了解這段期間發生了什麼事。
檔案中的主要章節:
- 目前的里程碑狀態(已完成哪些項目、接下來要做什麼)
- 已做出的決策及其原因
- 執行與示範方式(指令與快速冒煙測試)
- 已知問題與後續事項

這次執行過程中,實際的里程碑驗證如下:

在每個里程碑進行驗證
Codex 並非只寫好程式碼,就期待它能正常運作。每完成一個里程碑,它都會執行驗證指令,修正問題後才繼續。
以下是要求它使用的品質檢查指令範例:

以下則是 Codex 在 lint 檢查失敗後修正問題的範例:

智慧體打造了什麼
成果並不完美,也還沒準備好用於正式環境,但確實做了出來,而且可以測試。這次執行的標準不只是「能編譯」,而是「有沒有遵循指示,而且真的能用?」
已實作的主要功能:
- 畫布編輯(框架、群組、形狀、文字、圖片/圖示、按鈕、圖表)
- 即時協作(跨分頁同步上線狀態、游標、選取項目與編輯內容)
- 屬性檢查器控制項(幾何屬性、樣式、文字)
- 圖層管理(搜尋、重新命名、鎖定/隱藏、重新排序)
- 輔助線/對齊/吸附
- 歷程快照與還原
- 重播時間軸,以及從先前的時間點建立分支
- 原型模式(熱點與流程導覽)
- 留言(可標記為已解決或重新開啟的釘選討論串)
- 匯出(儲存/匯入/匯出,以及透過 CLI 匯出為 JSON 和 React + Tailwind)
執行長時間 Codex 任務的心得
讓這次執行成功的,不是單一巧妙的提示詞,而是以下要素的組合:
- 明確的目標與限制(規格檔案)
- 設有檢查點與驗收標準的里程碑(
plans.md) - 說明智慧體應如何執行工作的操作手冊(
implement.md) - 持續驗證(測試/lint/型別檢查/建置)
- 即時更新的狀態與稽核紀錄(
documentation.md),讓執行過程隨時可供檢視
這就是長時間程式開發工作的發展方向:不必時刻緊盯,而是在防護機制下委派更多工作。
試著讓 Codex 處理你自己的長時間任務
這次長達 25 小時的 Codex 執行,讓我們預見了程式開發的未來。我們正從單次提示詞與緊密配合的結對程式設計,走向能長時間工作的協作夥伴,由它從頭到尾完成一部分實際工作。你只需在各個里程碑引導方向,不必逐行緊盯程式碼。
我們為 Codex 設定的方向很簡單:讓它更懂得如何與人協作,更緊密地結合你的實際上下文,並透過防護機制,讓工作成果保持可靠、可供審查且容易交付。我們已經看到,當智慧體接手例行的實作與驗證工作,開發人員就能加快進度,把時間投入最重要的部分:設計、架構、產品決策,以及沒有現成範本可循的新問題。
而且,受惠的不只有開發人員。隨著 Codex 更善於掌握意圖,並提供計畫、驗證、預覽、還原等安全支援機制,更多非開發人員也能打造作品並持續改進,不必整天待在 IDE 裡。Codex 的各個介面與模型還會有更多進展,但核心目標始終不變:讓智慧體不再像是需要時刻緊盯的工具,而更像是能放心交付長時間工作的協作夥伴。
如果你也想親自試試,可以從這些資源開始: