For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航

快速模式

在 API 中获得最高达原来 2.5 倍的速度。

快速模式可提供最高达原来 2.5 倍的速度和更稳定的延迟,同时保留按量付费的灵活性。对于流量稳定、对延迟要求极高的高价值用户端应用,快速模式是理想选择。

优先处理已于 2026 年 7 月 30 日更名为快速模式。我们还提高了 gpt-5.6-sol 在快速模式下的运行速度,使其最高可达标准处理速度的 2.5 倍。 您可以在 API 请求中使用 service_tier: "priority"service_tier: "fast" 来使用此功能。

配置快速模式

您可以通过请求参数或项目设置,将发往 Responses API 或 Chat Completions API 的请求配置为使用快速模式。

要为单个请求启用快速模式,请将 service_tier 参数设为 fast。对于受支持的模型,将 service_tier 设为 priority 可获得相同的行为。

使用快速模式创建响应
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="What does 'fit check for my napalm era' mean?",
    service_tier="fast",
)
print(response)

要在项目级别启用快速模式,请打开 设置,选择 项目下的 常规 ,然后将 项目服务层级 改为 快速。此后,未指定 service_tier 的请求将默认使用快速模式。该项目的请求会随时间逐步过渡到快速模式。

ResponsesChat Completions 响应对象中的 service_tier 字段标识了处理请求所用的服务层级。对于 GPT-5.6 及更早的模型,无论请求指定的是 priority 还是 fast,响应都会返回 priority

速率限制与流量增长速率

基本限制

快速模式用量计入速率限制的方式与标准处理相同。请使用您常用的重试逻辑,并在每次尝试之间等待一段时间。对于同一个模型,标准处理和快速模式共享同一速率限制。

流量增长速率限制

如果您的流量增长过快,系统可能会将部分快速模式请求降为标准速度,并按标准费率收费。发生这种情况时,响应中会包含 service_tier: "default"。根据经验,一旦您的流量达到每分钟 100 万个输入 Token(TPM),每 15 分钟的增幅应不超过 50%。触发流量增长速率限制的具体阈值可能因模型和流量状况而异。

为避免触发流量增长速率限制,请遵循以下建议:

  • 更换模型或快照时,逐步增加流量。
  • 使用功能开关,在数小时内逐步切换流量,而非瞬间切换。
  • 避免在快速模式下运行大型提取、转换和加载(ETL)作业或批处理作业。

使用注意事项

  • 快速模式的每 Token 费用高于标准处理。有关详情和受支持的模型,请参阅定价页面
  • 缓存输入折扣仍适用于快速模式请求。
  • 快速模式支持多模态请求,包括图像输入。
  • 要在用量仪表板中查看快速模式请求,请选择按服务层级分组。对于 GPT-5.6 及更早的模型,即使您指定了 fast,这些请求也会显示为 priority
  • GPT-5.6 模型支持长上下文。快速模式不支持微调模型或嵌入向量。

常见问题

有关账户和政策的信息,请参阅快速模式常见问题

快速模式在所有地区都可用吗?

可用性取决于各司法管辖区的法律法规。如果您对所在地区的可用性有疑问,请联系您的客户总监。

快速模式与规模层级有何关系?

规模层级和快速模式相互独立。快速模式请求单独计费,不会消耗已购买的规模层级 TPM 套餐配额。超出规模层级配额的流量不会自动转入快速模式。

快速模式如何计费?

快速模式的每 Token 费用高于标准处理。所有处理模式的费用均计入您的年度企业消费承诺,符合条件的缓存输入 Token 可享受与标准处理相同的折扣。

对于 GPT-5.6 Sol,快速模式的费用是对应标准费率的两倍。短上下文请求的费用为每 100 万个输入 Token $8、每 100 万个输出 Token $40;长上下文请求的费用为每 100 万个输入 Token $16、每 100 万个输出 Token $60。GPT-5.6 Sol 的优惠价格至少持续至 2026 年 11 月 21 日。请参阅定价详情

要查看用量,请打开用量仪表板,选择 Responses 或 Chat Completions,然后按服务层级分组。要查看费用,请按账单明细项分组。

哪些模型和模态支持快速模式?

快速模式支持标准处理所提供的多模态能力,包括图像输入。GPT-5.6 模型支持长上下文。快速模式不支持微调模型或嵌入向量。未来的 GPT 模型可能支持快速模式,但不保证每个模型都支持。

流量增长速率限制是否跨项目或组织共享?

是的。您的所有流量都计入同一流量增长速率限制。如果您经常触发流量增长速率限制,可以考虑购买规模层级配额。

如果快速模式未达到延迟目标,会怎样?

GPT-6 Astra 的快速模式不包含延迟 SLA。对于 GPT-5.6 及更早的模型,快速模式和规模层级适用相同的服务级别协议条款;未达到延迟目标时,符合条件的企业协议可能会提供服务额度补偿。如果您有疑问或顾虑,请联系您的客户总监。

快速模式是否兼容数据驻留、零数据保留和 BAA?

快速模式兼容数据驻留、零数据保留和业务伙伴协议(BAA),具体取决于各模型的可用性。GPT-6 Astra 不支持在启用欧盟数据驻留的情况下使用快速模式。现有的端点、工具、资格和合同要求仍然适用。有关详情,请参阅“您的数据”指南