For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽
Codex

Codex use case

為 AI 應用程式加入評估

使用 Codex 將預期行為轉為 Promptfoo 評估套件。

Difficulty 中級
Time horizon 1 小時

請 Codex 檢查你的 AI 應用程式、找出要評估的行為,並加入可執行的 Promptfoo 評估套件。

最適合

  • 已有提示詞、模型呼叫、工具、檢索、智慧體或產品需求,但尚無可重複執行之評估套件的 AI 應用程式。
  • 正在準備變更模型、提示詞、檢索或智慧體,並希望在 Pull Request 合併前進行迴歸測試的團隊。
  • 需要將反覆的手動檢查轉為評估案例並提交至程式碼庫的品質審查。

Contents

    ← 所有使用案例

    為 AI 應用程式加入評估

    使用 Codex 將預期行為轉為 Promptfoo 評估套件。

    請 Codex 檢查你的 AI 應用程式、找出要評估的行為,並加入可執行的 Promptfoo 評估套件。

    中級
    1 小時

    請 Codex 檢查你的 AI 應用程式、找出要評估的行為,並加入可執行的 Promptfoo 評估套件。

    中級
    1 小時

    最適合

    • 已有提示詞、模型呼叫、工具、檢索、智慧體或產品需求,但尚無可重複執行之評估套件的 AI 應用程式。
    • 正在準備變更模型、提示詞、檢索或智慧體,並希望在 Pull Request 合併前進行迴歸測試的團隊。
    • 需要將反覆的手動檢查轉為評估案例並提交至程式碼庫的品質審查。

    技能與外掛程式

    • 包含 `$promptfoo-evals` 和 `$promptfoo-provider-setup` 的外掛程式,可用於建立、連接及執行評估套件,並進行品質檢查。
    Skill Why use it
    Promptfoo 包含 `$promptfoo-evals` 和 `$promptfoo-provider-setup` 的外掛程式,可用於建立、連接及執行評估套件,並進行品質檢查。

    起始提示詞

    使用 $promptfoo-evals 為這個 AI 應用程式加入 Promptfoo 評估套件。如果尚無可用的 Promptfoo 提供者或目標配接器,請先使用 $promptfoo-provider-setup。 要評估的行為: [support answer quality / tool-call correctness / retrieval grounding / business rules / agent task completion] 編輯前: - 檢查使用者實際使用的應用程式路徑,以及任何既有評估或測試。 - 提出最精簡且實用的評估計畫:目標配接器、初始案例、斷言、檔案、指令,以及必要的環境變數或本機服務。 - 在基準評估建立並執行完成前,不要變更正式環境的提示詞、模型設定或應用程式行為。 要求: - 盡可能測試使用者實際使用的應用程式路徑,而不只是原始模型提示詞。 - 確保測試資料不含密鑰、客戶資料或敏感個人資料。 - 加入本機評估指令,例如 `npm run evals`,或記錄要執行的確切指令。 最後請列出: - 已變更的檔案 - 已執行的評估指令 - 通過與未通過的案例 - 建議接著加入的評估
    使用 $promptfoo-evals 為這個 AI 應用程式加入 Promptfoo 評估套件。如果尚無可用的 Promptfoo 提供者或目標配接器,請先使用 $promptfoo-provider-setup。 要評估的行為: [support answer quality / tool-call correctness / retrieval grounding / business rules / agent task completion] 編輯前: - 檢查使用者實際使用的應用程式路徑,以及任何既有評估或測試。 - 提出最精簡且實用的評估計畫:目標配接器、初始案例、斷言、檔案、指令,以及必要的環境變數或本機服務。 - 在基準評估建立並執行完成前,不要變更正式環境的提示詞、模型設定或應用程式行為。 要求: - 盡可能測試使用者實際使用的應用程式路徑,而不只是原始模型提示詞。 - 確保測試資料不含密鑰、客戶資料或敏感個人資料。 - 加入本機評估指令,例如 `npm run evals`,或記錄要執行的確切指令。 最後請列出: - 已變更的檔案 - 已執行的評估指令 - 通過與未通過的案例 - 建議接著加入的評估

    簡介

    建構 AI 應用程式或變更既有應用程式時,你會希望確保其行為符合預期。評估可用來有系統地測試一組情境,並在發布前找出迴歸問題。

    你可以使用 Promptfoo 對 AI 應用程式執行評估,並使用 Codex 協助建立及維護這些評估。

    使用方式

    搭配 Promptfoo 外掛程式提供的 $promptfoo-evals 技能使用 Codex,將 AI 應用程式的一項行為轉為可重複執行的評估套件。若應用程式還沒有可用的 Promptfoo 目標,$promptfoo-provider-setup 可協助將套件連接至你要測試的應用程式路徑。

    Codex 可以檢查應用程式、提出能有效揭示問題的案例、加入 Promptfoo 組態與測試資料、在本機執行套件,並提供可供你持續使用的指令。

    此使用案例在行為定義具體時效果最佳,例如客服回答品質、檢索接地、分類器標籤、工具呼叫、JSON 結構、業務規則,或提示詞與模型遷移的可靠性。

    好的初版應包含可供審查的程式碼與測試資料:一份 promptfooconfig.yaml 或同等組態、一個小型 evals/ 目錄、測試案例、呼叫應用程式所需的目標配接器,以及如 npm run evals 之類的本機指令。

    決定要評估的內容

    先從一項使用者可觀察的產品承諾著手。避免要求 Codex 一次評估整個 AI 系統。規模較小的套件較值得信賴,也更容易審查和持續執行。

    適合作為首個評估目標的項目包括:

    • 正確性: 分類、擷取、摘要、路由或轉換。
    • 接地: 回答應以檢索到的文件或引用來源為依據。
    • 工具使用: 選擇正確的工具、傳入有效引數,以及處理工具錯誤。
    • 格式或業務規則: JSON 結構描述、欄位名稱、業務規則限制或 UI 顯示文案規範。
    • 提示詞或模型遷移: 確保新的提示詞、模型、系統訊息或檢索設定不會讓重要案例失敗。

    請從產品需求、錯誤回報、需升級處理的客服問題,或團隊願意提交至程式碼庫且已移除敏感資料的範例著手。

    要求提供評估計畫

    Codex 應在編輯前先檢查。請它提出一份計畫,列出目標路徑、測試資料、斷言、配接器及指令。如此一來,你就能在加入檔案前,先發現目標選錯或測試案例效力不足的問題。

    實作前請先審查計畫。計畫應列出 Promptfoo 將呼叫的應用程式路徑或端點、首批初始案例、斷言、Codex 將建立的檔案、本機指令,以及任何必要的密鑰或服務。若計畫測試的是原始模型,而不是使用者實際使用的應用程式路徑,請詢問 Codex 是否刻意如此安排。

    實作、執行及迭代

    計畫確認無誤後,請 Codex 加以實作。第一版實作應力求單純:組態、案例、測試資料、必要時使用的目標配接器、一個指令,以及該指令已執行的證明。

    一個以應用程式為測試目標的小型套件可能如下:

    evals/
      promptfooconfig.yaml
      tests/
        cases.yaml
      providers/
        provider.js  # only if the built-in provider cannot call the app directly

    變更行為前先執行套件。基準評估結果可讓你判斷應用程式是否本來就無法通過這些案例、斷言是否需要調整,或目標配接器是否有誤。若斷言容易因細微變更而失敗或定義過於模糊,請加以調整,但不要因此掩蓋真正的產品問題。

    首次執行後,請使用套件比較應用程式變更,再予以發布。每當錯誤、上線需求或產品審查顯示有某項行為需要保持穩定時,就加入新案例。本機指令穩定後,請 Codex 將其加入 CI 或發布檢查清單。

    相關使用案例