For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegação principal

Texto em fala

Aprenda a transformar texto em áudio com fala natural.

A Audio API oferece um endpoint speech baseado no nosso modelo GPT-4o mini TTS (texto em fala). Ele inclui 11 vozes integradas e pode ser usado para:

  • Narrar uma postagem de blog
  • Produzir áudio de fala em vários idiomas
  • Fornecer saída de áudio em tempo real por streaming

Veja um exemplo da voz alloy:

Nossas políticas de uso exigem que você informe claramente aos usuários finais que a voz TTS que estão ouvindo é gerada por IA e não é uma voz humana.

Início rápido

O endpoint speech recebe três entradas principais:

  1. O modelo que você está usando
  2. O texto a ser convertido em áudio
  3. A voz que será usada para falar o conteúdo

Veja um exemplo simples de solicitação:

Gere áudio de fala a partir do texto de entrada
from pathlib import Path
from openai import OpenAI

client = OpenAI()
speech_file_path = Path(__file__).parent / "speech.mp3"

with client.audio.speech.with_streaming_response.create(
    model="gpt-4o-mini-tts",
    voice="coral",
    input="Today is a wonderful day to build something people love!",
    instructions="Speak in a cheerful and positive tone.",
) as response:
    response.stream_to_file(speech_file_path)

Por padrão, o endpoint retorna um MP3 com o áudio de fala, mas você pode configurá-lo para retornar qualquer formato compatível.

Modelos de texto em fala

Para aplicações inteligentes em tempo real, use o modelo gpt-4o-mini-tts, nosso modelo de texto em fala mais recente e confiável. Você pode usar prompts para controlar aspectos da fala, incluindo:

  • Sotaque
  • Variedade de emoções
  • Entonação
  • Imitações
  • Velocidade da fala
  • Tom
  • Sussurros

Nossos outros modelos de texto em fala são tts-1 e tts-1-hd. O modelo tts-1 oferece menor latência, mas com qualidade inferior à do modelo tts-1-hd.

Opções de voz

O endpoint TTS oferece 13 vozes integradas para controlar como o texto é convertido em fala. Ouça e experimente essas vozes no OpenAI.fm, nossa demonstração interativa para testar o modelo de texto em fala mais recente da API da OpenAI. Atualmente, as vozes são otimizadas para o inglês.

  • alloy
  • ash
  • ballad
  • coral
  • echo
  • fable
  • nova
  • onyx
  • sage
  • shimmer
  • verse
  • marin
  • cedar

Para obter a melhor qualidade, recomendamos usar marin ou cedar.

A disponibilidade de vozes depende do modelo. Os modelos tts-1 e tts-1-hd oferecem suporte a um conjunto menor: alloy, ash, coral, echo, fable, onyx, nova, sage e shimmer.

Se você estiver usando a Realtime API, observe que o conjunto de vozes disponíveis é um pouco diferente. Consulte o guia de conversas em tempo real para ver as vozes disponíveis atualmente para uso em tempo real.

Streaming de áudio em tempo real

A Speech API oferece suporte a streaming de áudio em tempo real usando codificação de transferência em blocos. Isso significa que o áudio pode ser reproduzido antes que o arquivo completo seja gerado e disponibilizado.

Transmita áudio de fala por streaming a partir do texto de entrada diretamente para seus alto-falantes
import asyncio

from openai import AsyncOpenAI
from openai.helpers import LocalAudioPlayer

openai = AsyncOpenAI()


async def main() -> None:
    async with openai.audio.speech.with_streaming_response.create(
        model="gpt-4o-mini-tts",
        voice="coral",
        input="Today is a wonderful day to build something people love!",
        instructions="Speak in a cheerful and positive tone.",
        response_format="pcm",
    ) as response:
        await LocalAudioPlayer().play(response)


if __name__ == "__main__":
    asyncio.run(main())

Para obter os menores tempos de resposta, recomendamos usar wav ou pcm como formato de resposta.

Formatos de saída compatíveis

O formato de resposta padrão é mp3, mas outros formatos, como opus e wav, estão disponíveis.

  • MP3: O formato de resposta padrão para casos de uso em geral.
  • Opus: Para streaming e comunicação pela internet, com baixa latência.
  • AAC: Para compressão de áudio digital, preferido pelo YouTube, Android e iOS.
  • FLAC: Para compressão de áudio sem perdas, preferido por entusiastas de áudio para arquivamento.
  • WAV: Áudio WAV sem compressão, adequado para aplicações de baixa latência por evitar o processamento adicional de decodificação.
  • PCM: Semelhante ao WAV, mas contém as amostras brutas em 24 kHz (16 bits com sinal, low-endian), sem o cabeçalho.

Idiomas compatíveis

Em geral, o modelo TTS segue o modelo Whisper em relação ao suporte a idiomas. O Whisper oferece suporte aos seguintes idiomas e apresenta bom desempenho, apesar de as vozes serem otimizadas para o inglês:

Africâner, árabe, armênio, azerbaijano, bielorrusso, bósnio, búlgaro, catalão, chinês, croata, tcheco, dinamarquês, holandês, inglês, estoniano, finlandês, francês, galego, alemão, grego, hebraico, hindi, húngaro, islandês, indonésio, italiano, japonês, canarês, cazaque, coreano, letão, lituano, macedônio, malaio, marata, maori, nepalês, norueguês, persa, polonês, português, romeno, russo, sérvio, eslovaco, esloveno, espanhol, suaíli, sueco, tagalo, tâmil, tailandês, turco, ucraniano, urdu, vietnamita e galês.

Você pode gerar áudio de fala nesses idiomas fornecendo o texto de entrada no idioma de sua escolha.

Vozes personalizadas

Crie uma voz personalizada aprovada a partir da gravação de consentimento de um locutor e de uma amostra de áudio correspondente. Consulte Vozes personalizadas para saber mais sobre elegibilidade, requisitos de gravação, frases de consentimento e requisições à API.

Como criar uma voz

Siga as instruções em Criar uma voz personalizada.

Usar uma voz durante a geração de fala

Informe o ID da voz criada ao gerar fala. Consulte os exemplos de geração de fala.

Visão geral de tempo real e áudio

Escolha a abordagem certa para agentes de voz, tradução, transcrição e geração de fala.

Conceitos de áudio e fala

Revise as modalidades de áudio, as tarefas de fala, o streaming e as APIs baseadas em requisições.