For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

modo Fast

Obtenha velocidades até 2,5× maiores na API.

O modo Fast oferece velocidades até 2,5× maiores e latência mais consistente, mantendo a flexibilidade do pagamento conforme o uso. O modo Fast é ideal para aplicações de alto valor voltadas ao usuário, com tráfego regular e nas quais a latência é essencial.

O processamento prioritário passou a se chamar modo Fast em 30 de julho de 2026. Também aumentamos a velocidade do modo Fast para gpt-5.6-sol, tornando-o até 2,5× mais rápido que o processamento padrão. Você pode usar service_tier: "priority" ou service_tier: "fast" nas suas requisições à API para acessar essa funcionalidade.

Como configurar o modo Fast

Você pode configurar requisições à Responses API ou à API Chat Completions para usar o modo Fast por meio de um parâmetro de requisição ou de uma configuração do projeto.

Para ativar o modo Fast em uma requisição individual, defina o parâmetro service_tier como fast. Definir service_tier como priority produz o mesmo comportamento nos modelos compatíveis.

Crie uma resposta com o modo Fast
from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="What does 'fit check for my napalm era' mean?",
    service_tier="fast",
)
print(response)

Para ativar no nível do projeto, abra Configurações, selecione Geral em Projeto e altere Nível de serviço do projeto para Fast. As requisições que não especificarem um service_tier passarão a usar o modo Fast por padrão. As requisições do projeto migrarão gradualmente para o modo Fast ao longo do tempo.

O campo service_tier no objeto de resposta de Responses ou Chat Completions identifica o nível usado para processar a requisição. Para GPT-5.6 e modelos anteriores, a resposta retorna priority, independentemente de a requisição especificar priority ou fast.

Limites de taxa e taxa de crescimento do tráfego

Limites básicos

O consumo no modo Fast é contabilizado nos limites de taxa da mesma forma que no processamento padrão. Use sua lógica habitual de novas tentativas e aguarde entre elas. Para um determinado modelo, o processamento padrão e o modo Fast compartilham o mesmo limite de taxa.

Limite da taxa de crescimento do tráfego

Se o tráfego aumentar rápido demais, o sistema poderá processar algumas requisições do modo Fast em velocidades padrão e cobrar as tarifas padrão. Quando isso acontece, a resposta contém service_tier: "default". Como regra geral, quando o tráfego atingir 1 milhão de tokens de entrada por minuto (TPM), aumente-o em no máximo 50% a cada 15 minutos. O ponto exato em que o limite da taxa de crescimento do tráfego se aplica pode variar conforme o modelo e as condições de tráfego.

Para evitar acionar o limite da taxa de crescimento do tráfego:

  • Aumente o tráfego gradualmente ao trocar de modelo ou snapshot.
  • Use flags de recurso para transferir o tráfego ao longo de horas, e não instantaneamente.
  • Evite executar tarefas de extração, transformação e carga (ETL) ou de processamento em lote de grande porte no modo Fast.

Considerações de uso

  • O modo Fast cobra um valor adicional por token em relação ao processamento padrão. Consulte a página de preços para ver detalhes e modelos compatíveis.
  • Os descontos para entradas em cache continuam válidos para requisições no modo Fast.
  • O modo Fast oferece suporte a requisições multimodais, incluindo entradas de imagem.
  • Para visualizar as requisições do modo Fast no painel de uso, selecione a opção de agrupar por nível de serviço. Para GPT-5.6 e modelos anteriores, essas requisições aparecem como priority, mesmo quando você especifica fast.
  • Os modelos GPT-5.6 oferecem suporte a contexto longo. O modo Fast não oferece suporte a modelos com ajuste fino nem a embeddings.

Perguntas frequentes

Para informações sobre contas e políticas, consulte as perguntas frequentes sobre o modo Fast.

O modo Fast está disponível em todas as regiões?

A disponibilidade depende das leis e regulamentações de cada jurisdição. Entre em contato com o responsável pela sua conta se tiver dúvidas sobre a disponibilidade na sua região.

Como o modo Fast interage com o Nível de escala?

O Nível de escala e o modo Fast são separados. As requisições do modo Fast são cobradas separadamente e não consomem os pacotes de TPM adquiridos para o Nível de escala. O tráfego que excede o Nível de escala não é transferido automaticamente para o modo Fast.

Como o modo Fast é cobrado?

O modo Fast cobra um valor adicional por token em comparação com o processamento padrão. Todos os modos de processamento são contabilizados no compromisso anual de gastos da sua empresa, e os tokens de entrada em cache elegíveis recebem os mesmos descontos disponíveis no processamento padrão.

Para o GPT-5.6 Sol, o modo Fast custa o dobro da tarifa padrão correspondente. Requisições de contexto curto custam US$ 8 por 1 milhão de tokens de entrada e US$ 40 por 1 milhão de tokens de saída; requisições de contexto longo custam US$ 16 por 1 milhão de tokens de entrada e US$ 60 por 1 milhão de tokens de saída. Os preços promocionais do GPT-5.6 Sol estão disponíveis pelo menos até 21 de novembro de 2026. Consulte os detalhes de preços.

Para consultar o uso, abra o painel de uso, selecione Responses ou Chat Completions e agrupe por nível de serviço. Para consultar os custos, agrupe por item de cobrança.

Quais modelos e modalidades oferecem suporte ao modo Fast?

O modo Fast oferece suporte às capacidades multimodais disponíveis no processamento padrão, incluindo entradas de imagem. Os modelos GPT-5.6 oferecem suporte a contexto longo. O modo Fast não oferece suporte a modelos com ajuste fino nem a embeddings. Futuros modelos GPT poderão oferecer suporte ao modo Fast, mas esse suporte não é garantido para todos os modelos.

Os limites da taxa de crescimento do tráfego são compartilhados entre projetos ou organizações?

Sim. Todo o seu tráfego é contabilizado no mesmo limite da taxa de crescimento do tráfego. Se você atingir esse limite com frequência, considere adquirir uma cota do Nível de escala.

O que acontece se o modo Fast não atingir a meta de latência?

O modo Fast para o GPT-6 Astra não inclui um SLA de latência. Para GPT-5.6 e modelos anteriores, o modo Fast e o Nível de escala recebem o mesmo tratamento em termos de acordo de nível de serviço, e contratos empresariais elegíveis podem oferecer créditos de serviço quando as metas de latência não são atingidas. Entre em contato com o responsável pela sua conta se tiver dúvidas ou preocupações.

O modo Fast é compatível com residência de dados, zero retenção de dados e um BAA?

O modo Fast é compatível com residência de dados, zero retenção de dados e um Acordo de Associado Comercial (BAA), sujeito à disponibilidade específica de cada modelo. O GPT-6 Astra não oferece suporte ao modo Fast com residência de dados na UE. Os requisitos existentes de endpoints, ferramentas, elegibilidade e contratos continuam válidos. Consulte o guia Seus dados para mais detalhes.