For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主要導覽

彈性處理

透過彈性處理最佳化成本。

彈性處理可降低 ResponsesChat Completions 請求的成本,但回應時間較長,且偶爾會遇到資源無法使用的情況。適合非正式環境或優先順序較低的任務,例如模型評估、資料擴充和非同步工作負載。

Token 依照批次處理 API 費率計價,並可透過提示詞快取享有額外折扣。

彈性處理目前處於 Beta 階段,僅支援部分模型。支援的模型 列於定價頁面

API 使用方式

若要使用彈性處理,請在 API 請求中將 service_tier 參數設為 flex

彈性處理範例
from openai import OpenAI

client = OpenAI(
    # increase default timeout to 15 minutes (from 10 minutes)
    timeout=900.0
)

# you can override the max timeout per request as well
response = client.with_options(timeout=900.0).responses.create(
    model="gpt-6-astra",
    instructions="List and describe all the metaphors used in this book.",
    input="<very long text of book here>",
    service_tier="flex",
)

print(response.output_text)

API 請求逾時

由於彈性處理的速度較慢,請求更容易逾時。以下是處理逾時時需要考量的事項:

  • 預設逾時時間:使用官方 OpenAI SDK 發出 API 請求時,預設逾時時間為 10 分鐘 。若提示詞較長或任務較複雜,您可能需要延長此時間。
  • 設定逾時時間:各 SDK 都會提供可延長逾時時間的參數。在 Python 和 JavaScript SDK 中,此參數為 timeout,如上方程式碼範例所示。
  • 自動重試:對於傳回 408 Request Timeout 錯誤碼的請求,OpenAI SDK 會先自動重試兩次,之後才擲回例外狀況。

資源無法使用錯誤

彈性處理有時可能沒有足夠的資源來處理您的請求,因此傳回 429 Resource Unavailable 錯誤碼。 發生這種情況時,不會向您收費。

您可以考慮採用以下策略,處理資源無法使用的錯誤:

  • 採用指數退避策略重試請求:指數退避策略適合能容忍延遲、且希望盡量降低成本的工作負載,因為當有更多可用容量時,您的請求最終就能完成。如需實作細節,請參閱這篇 Cookbook

  • 改用標準處理重試請求:收到資源無法使用的錯誤時,若您的使用情境可接受偶爾較高的成本,以確保請求順利完成,便可採用標準處理的重試策略。做法是在重試的請求中將 service_tier 設為 auto,或移除 service_tier 參數,改用專案的預設模式。