Codex use case
為 AI 應用程式加入評估
使用 Codex 將預期行為轉為 Promptfoo 評估套件。
請 Codex 檢查你的 AI 應用程式、找出要評估的行為,並加入可執行的 Promptfoo 評估套件。
最適合
- 已有提示詞、模型呼叫、工具、檢索、智慧體或產品需求,但尚無可重複執行之評估套件的 AI 應用程式。
- 正在準備變更模型、提示詞、檢索或智慧體,並希望在 Pull Request 合併前進行迴歸測試的團隊。
- 需要將反覆的手動檢查轉為評估案例並提交至程式碼庫的品質審查。
Contents
為 AI 應用程式加入評估
使用 Codex 將預期行為轉為 Promptfoo 評估套件。
請 Codex 檢查你的 AI 應用程式、找出要評估的行為,並加入可執行的 Promptfoo 評估套件。
最適合
- 已有提示詞、模型呼叫、工具、檢索、智慧體或產品需求,但尚無可重複執行之評估套件的 AI 應用程式。
- 正在準備變更模型、提示詞、檢索或智慧體,並希望在 Pull Request 合併前進行迴歸測試的團隊。
- 需要將反覆的手動檢查轉為評估案例並提交至程式碼庫的品質審查。
技能與外掛程式
- 包含 `$promptfoo-evals` 和 `$promptfoo-provider-setup` 的外掛程式,可用於建立、連接及執行評估套件,並進行品質檢查。
| Skill | Why use it |
|---|---|
| Promptfoo | 包含 `$promptfoo-evals` 和 `$promptfoo-provider-setup` 的外掛程式,可用於建立、連接及執行評估套件,並進行品質檢查。 |
起始提示詞
簡介
建構 AI 應用程式或變更既有應用程式時,你會希望確保其行為符合預期。評估可用來有系統地測試一組情境,並在發布前找出迴歸問題。
你可以使用 Promptfoo 對 AI 應用程式執行評估,並使用 Codex 協助建立及維護這些評估。
使用方式
搭配 Promptfoo 外掛程式提供的 $promptfoo-evals 技能使用 Codex,將 AI 應用程式的一項行為轉為可重複執行的評估套件。若應用程式還沒有可用的 Promptfoo 目標,$promptfoo-provider-setup 可協助將套件連接至你要測試的應用程式路徑。
Codex 可以檢查應用程式、提出能有效揭示問題的案例、加入 Promptfoo 組態與測試資料、在本機執行套件,並提供可供你持續使用的指令。
此使用案例在行為定義具體時效果最佳,例如客服回答品質、檢索接地、分類器標籤、工具呼叫、JSON 結構、業務規則,或提示詞與模型遷移的可靠性。
好的初版應包含可供審查的程式碼與測試資料:一份 promptfooconfig.yaml 或同等組態、一個小型 evals/ 目錄、測試案例、呼叫應用程式所需的目標配接器,以及如 npm run evals 之類的本機指令。
決定要評估的內容
先從一項使用者可觀察的產品承諾著手。避免要求 Codex 一次評估整個 AI 系統。規模較小的套件較值得信賴,也更容易審查和持續執行。
適合作為首個評估目標的項目包括:
- 正確性: 分類、擷取、摘要、路由或轉換。
- 接地: 回答應以檢索到的文件或引用來源為依據。
- 工具使用: 選擇正確的工具、傳入有效引數,以及處理工具錯誤。
- 格式或業務規則: JSON 結構描述、欄位名稱、業務規則限制或 UI 顯示文案規範。
- 提示詞或模型遷移: 確保新的提示詞、模型、系統訊息或檢索設定不會讓重要案例失敗。
請從產品需求、錯誤回報、需升級處理的客服問題,或團隊願意提交至程式碼庫且已移除敏感資料的範例著手。
要求提供評估計畫
Codex 應在編輯前先檢查。請它提出一份計畫,列出目標路徑、測試資料、斷言、配接器及指令。如此一來,你就能在加入檔案前,先發現目標選錯或測試案例效力不足的問題。
實作前請先審查計畫。計畫應列出 Promptfoo 將呼叫的應用程式路徑或端點、首批初始案例、斷言、Codex 將建立的檔案、本機指令,以及任何必要的密鑰或服務。若計畫測試的是原始模型,而不是使用者實際使用的應用程式路徑,請詢問 Codex 是否刻意如此安排。
實作、執行及迭代
計畫確認無誤後,請 Codex 加以實作。第一版實作應力求單純:組態、案例、測試資料、必要時使用的目標配接器、一個指令,以及該指令已執行的證明。
一個以應用程式為測試目標的小型套件可能如下:
evals/
promptfooconfig.yaml
tests/
cases.yaml
providers/
provider.js # only if the built-in provider cannot call the app directly
變更行為前先執行套件。基準評估結果可讓你判斷應用程式是否本來就無法通過這些案例、斷言是否需要調整,或目標配接器是否有誤。若斷言容易因細微變更而失敗或定義過於模糊,請加以調整,但不要因此掩蓋真正的產品問題。
首次執行後,請使用套件比較應用程式變更,再予以發布。每當錯誤、上線需求或產品審查顯示有某項行為需要保持穩定時,就加入新案例。本機指令穩定後,請 Codex 將其加入 CI 或發布檢查清單。