使用 OpenAI 模型時,有多種方法可以降低成本。成本與延遲通常密切相關;減少 Token 數量與請求次數,一般也能加快處理速度。此外,OpenAI 的 Batch API 和彈性處理也能協助降低成本。
成本與延遲
若要降低延遲與成本,可以考慮以下策略:
- 減少請求:減少完成任務所需的請求次數。
- 盡量減少 Token:減少輸入 Token 的數量,並透過最佳化讓模型輸出更精簡。
- 選用較小的模型:選擇能兼顧準確度、較低成本與較低延遲的模型。
如需深入瞭解這些策略,請參閱我們的延遲最佳化指南。
Batch API
以非同步方式處理作業。Batch API 提供一組簡單易用的端點,讓你將多個請求彙整至單一檔案,啟動批次處理作業來執行這些請求,在請求執行期間查詢該批次的狀態,並在批次完成後取得彙整的結果。
彈性處理
大幅降低 Chat Completions 或 Responses 請求的成本,但回應時間較長,且偶爾會遇到資源無法使用的情況。適合非正式環境或優先順序較低的任務,例如模型評估、資料擴充或非同步工作負載。