For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Conceitos essenciais

Conceitos essenciais para trabalhar com a API da OpenAI.

Na OpenAI, proteger os dados dos usuários é fundamental para nossa missão. Não treinamos nossos modelos com as entradas e saídas da nossa API. Saiba mais na nossa página sobre privacidade de dados da API.

Modelos de geração de texto

Os modelos de geração de texto da OpenAI (frequentemente chamados de transformers generativos pré-treinados ou, de forma abreviada, modelos "GPT"), como gpt-6-astra e gpt-5.6-terra, foram treinados para compreender a linguagem natural e a linguagem formal. Esses modelos geram saídas de texto em resposta às entradas que recebem. As entradas desses modelos também são chamadas de "prompts". Criar um prompt é, essencialmente, a maneira de "programar" um modelo, geralmente fornecendo instruções ou alguns exemplos de como concluir uma tarefa com sucesso. Os modelos GPT podem ser usados em uma grande variedade de tarefas, incluindo geração de conteúdo ou código, resumo, conversação, escrita criativa e muito mais. Saiba mais no nosso guia introdutório de geração de texto e no nosso guia de engenharia de prompt.

Embeddings

Um embedding é uma representação vetorial de um dado (por exemplo, um trecho de texto), criada para preservar aspectos de seu conteúdo e/ou significado. Dados semelhantes em algum aspecto tendem a ter embeddings mais próximos entre si do que dados sem relação. A OpenAI oferece modelos de embeddings de texto que recebem uma string de texto como entrada e produzem um vetor de embedding como saída. Embeddings são úteis para pesquisa, agrupamento, recomendações, detecção de anomalias, classificação e muito mais. Saiba mais sobre embeddings no nosso guia de embeddings.

Tokens

Os modelos de geração de texto e de embeddings processam o texto em blocos chamados tokens. Os tokens representam sequências de caracteres que ocorrem com frequência. Por exemplo, a string " tokenization" é decomposta em " token" e "ization", enquanto uma palavra curta e comum como " the" é representada por um único token. Observe que, em uma frase, o primeiro token de cada palavra geralmente começa com um caractere de espaço. Use nossa ferramenta de tokenização para testar strings específicas e ver como elas são convertidas em tokens. Como regra prática, 1 token corresponde a aproximadamente 4 caracteres ou 0,75 palavra em textos em inglês.

Uma limitação a considerar é que, para um modelo de geração de texto, o tamanho combinado do prompt e da saída gerada não pode ultrapassar o tamanho máximo de contexto do modelo. Para modelos de embeddings (que não produzem tokens como saída), a entrada deve ser menor que o tamanho máximo de contexto do modelo. Você pode consultar os tamanhos máximos de contexto de cada modelo de geração de texto e de embeddings no índice de modelos.