快速模式可讓速度最高達原本的 2.5 倍,延遲也更穩定,同時保有隨用隨付的彈性。快速模式適合流量穩定、對延遲極為敏感,且直接面向使用者的高價值應用程式。
優先處理已於 2026 年 7 月 30 日更名為快速模式。我們也提升了
gpt-5.6-sol 在快速模式下的執行速度,使其最高可達標準處理的
2.5 倍。你可以在 API 請求中使用 service_tier: "priority"
或 service_tier: "fast" 來使用這項功能。
設定快速模式
你可以透過請求參數或專案設定,讓傳送至 Responses API 或 Chat Completions API 的請求使用快速模式。
若要為個別請求啟用快速模式,請將 service_tier 參數設為 fast。對於支援的模型,將 service_tier 設為 priority 也會產生相同的行為。
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="What does 'fit check for my napalm era' mean?",
service_tier="fast",
)
print(response)若要在專案層級啟用快速模式,請開啟 設定,選取 專案下的 一般 ,然後將 專案服務層級 改為 快速。之後,未指定 service_tier 的請求便會預設使用快速模式。專案的請求會隨時間逐步轉換至快速模式。
Responses 或 Chat Completions 回應物件中的 service_tier 欄位會標示處理請求時使用的層級。對於 GPT-5.6 及更早的模型,無論請求指定的是 priority 還是 fast,回應都會傳回 priority。
速率限制與流量增長速率
基本限制
快速模式的用量與標準處理一樣,都會計入速率限制。請使用你慣用的重試邏輯,並在每次嘗試之間等待一段時間。同一模型的標準處理與快速模式共用相同的速率限制。
流量增長速率限制
如果流量增長過快,系統可能會將部分快速模式請求降為標準速度,並按標準費率收費。發生這種情況時,回應會包含 service_tier: "default"。一般建議是,當流量達到每分鐘 100 萬個輸入 Token(TPM)後,每 15 分鐘的增幅不應超過 50%。流量增長速率限制的實際觸發點可能因模型和流量狀況而異。
若要避免觸發流量增長速率限制:
- 切換模型或快照時,請逐步增加流量。
- 使用功能旗標,在數小時內逐步轉移流量,避免瞬間切換。
- 避免在快速模式下執行大型擷取、轉換與載入(ETL)作業或批次作業。
使用注意事項
- 快速模式的每個 Token 費率高於標準處理。如需詳細資訊與支援的模型,請參閱定價頁面。
- 快取輸入折扣仍適用於快速模式請求。
- 快速模式支援多模態請求,包括圖像輸入。
- 若要在用量儀表板中查看快速模式請求,請選擇依服務層級分組。對於 GPT-5.6 及更早的模型,即使你指定
fast,這些請求仍會顯示為priority。 - GPT-5.6 模型支援長上下文。快速模式不支援微調模型或嵌入向量。
常見問題
如需帳戶與政策資訊,請參閱快速模式常見問題。
所有地區都能使用快速模式嗎?
能否使用取決於各司法管轄區的法律與法規。如果你對所在地區能否使用有疑問,請聯絡你的客戶總監。
快速模式與規模層級之間有何關係?
規模層級與快速模式彼此獨立。快速模式請求會單獨計費,不會計入已購買的規模層級 TPM 套餐額度。超出規模層級額度的流量不會自動轉至快速模式。
快速模式如何計費?
快速模式的每個 Token 費率高於標準處理。所有處理模式的費用都會計入你的年度企業消費承諾額,符合資格的快取輸入 Token 也能享有與標準處理相同的折扣。
對於 GPT-5.6 Sol,快速模式的費率是相應標準費率的兩倍。短上下文請求的費用為每 100 萬個輸入 Token $8、每 100 萬個輸出 Token $40;長上下文請求則為每 100 萬個輸入 Token $16、每 100 萬個輸出 Token $60。GPT-5.6 Sol 的促銷價格至少適用至 2026 年 11 月 21 日。請參閱定價詳情。
若要查看用量,請開啟用量儀表板,選取 Responses 或 Chat Completions,並依服務層級分組。若要查看費用,請依明細項目分組。
哪些模型與模態支援快速模式?
快速模式支援標準處理所提供的多模態能力,包括圖像輸入。GPT-5.6 模型支援長上下文。快速模式不支援微調模型或嵌入向量。未來的 GPT 模型可能會支援快速模式,但不保證每個模型都支援。
不同專案或組織是否共用流量增長速率限制?
是的。你的所有流量都會計入同一個流量增長速率限制。如果你經常觸發流量增長速率限制,可以考慮購買規模層級配額。
如果快速模式未達到延遲目標,會怎麼樣?
GPT-6 Astra 的快速模式不包含延遲 SLA。對於 GPT-5.6 及更早的模型,快速模式與規模層級適用相同的服務等級協議待遇;若未達到延遲目標,符合資格的企業協議可能會提供服務點數。如果你有任何疑問或疑慮,請聯絡你的客戶總監。
快速模式是否相容於資料駐留、零資料保留及 BAA?
快速模式相容於資料駐留、零資料保留及業務夥伴協議(BAA),但實際可用情況取決於個別模型。GPT-6 Astra 不支援在使用歐盟資料駐留的同時使用快速模式。既有的端點、工具、資格與合約要求仍然適用。如需詳細資訊,請參閱「你的資料」指南。