A transcrição converte fala em texto. Escolha um fluxo de trabalho conforme seu áudio já esteja gravado ou esteja chegando ao vivo. Cada fluxo de trabalho tem um modelo recomendado para começar.
Escolha um fluxo de trabalho de transcrição
| Fluxo de trabalho | Quando usar | Modelo recomendado |
|---|---|---|
| Transcrição de arquivos | Você tem uma gravação concluída ou uma solicitação de áudio delimitada. Envie o arquivo e receba a transcrição final ou receba o texto por streaming enquanto o arquivo é processado. | gpt-transcribe |
Transcrição em tempo real | Você tem áudio ao vivo de um microfone, uma chamada ou outra fonte e precisa do texto à medida que a fala chega. | gpt-live-transcribe |
Receber a saída por streaming e usar áudio ao vivo são decisões separadas. Você pode receber a transcrição de um arquivo concluído por streaming sem abrir uma sessão Realtime. Use Realtime apenas quando seu áudio estiver chegando ao vivo ou você precisar de uma conexão persistente.
Escolha um recurso especializado
Comece com o modelo recomendado para seu fluxo de trabalho. Troque de modelo apenas quando seu aplicativo exigir um recurso que o modelo padrão não oferece.
| Se você precisa de | Use |
|---|---|
| Transcrições com identificação de falantes | gpt-4o-transcribe-diarize com transcrição de arquivos. |
Marcações de tempo por palavra ou legendas srt e vtt | whisper-1 com transcrição de arquivos. |
| Tradução de uma gravação concluída para o inglês | whisper-1 com o endpoint de tradução de áudio. |
| Idiomas de entrada detectados | gpt-transcribe com transcrição de arquivos. |
| Transcrição de turnos confirmados via WebSocket | gpt-transcribe com transcrição em tempo real. |
As integrações existentes podem continuar usando gpt-4o-transcribe, gpt-4o-mini-transcribe ou gpt-realtime-whisper quando houver suporte. Esses não são os modelos recomendados para iniciar uma nova integração de transcrição.
Consulte os preços de transcrição e teste a opção recomendada com áudio representativo antes de migrar o tráfego de produção.
Melhore a qualidade da transcrição
gpt-transcribe e gpt-live-transcribe aceitam três tipos de contexto:
prompt: Contexto em formato livre sobre a gravação, como o assunto ou a situação em que foi feita.keywords: Termos literais que podem aparecer no áudio, como nomes de produtos, medicamentos ou siglas.languages: Uma lista dos idiomas de entrada esperados quando a gravação pode conter mais de um idioma.
Use essas entradas apenas para fornecer contexto relevante ao áudio; não repita a tarefa de transcrição. As palavras-chave são dicas, não conteúdo obrigatório na saída. A transcrição só deve incluir uma palavra-chave quando ela estiver presente no áudio.
Esses modelos usam languages em vez do campo no singular language. Os modelos de transcrição existentes que aceitam a indicação de um único idioma continuam usando language.
Quando gpt-transcribe transcreve o áudio de entrada em uma sessão da Realtime API ou é executado em uma sessão dedicada de transcrição, ele usa automaticamente os turnos transcritos anteriormente como contexto.
Teste com áudio representativo
Teste a transcrição nas condições de áudio que seu aplicativo encontrará. Inclua:
- Idiomas de interesse, sotaques e padrões de alternância entre idiomas.
- Ruído de fundo, qualidade do microfone e áudio de telefonia.
- Nomes, números, datas, sequências alfanuméricas e terminologia do domínio.
- Falas curtas, gravações longas e falas interrompidas.
Acompanhe os erros relevantes para o aplicativo em vez de se basear apenas na taxa de erro de palavras. Por exemplo, teste nomes de medicamentos em um fluxo de trabalho de saúde ou números de pedidos em um fluxo de trabalho de suporte.