For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navegación principal

Texto a voz

Aprende a convertir texto en audio hablado con una voz natural.

La API de audio ofrece un punto de acceso speech basado en nuestro modelo GPT-4o mini TTS (texto a voz). Incluye 11 voces integradas y se puede usar para:

  • Narrar una publicación escrita de un blog
  • Producir audio hablado en varios idiomas
  • Ofrecer salida de audio en tiempo real mediante streaming

Este es un ejemplo de la voz alloy:

Nuestras políticas de uso te exigen informar claramente a los usuarios finales que la voz TTS que escuchan es generada por IA y no es una voz humana.

Inicio rápido

El punto de acceso speech recibe tres entradas clave:

  1. El modelo que usas
  2. El texto que se convertirá en audio
  3. La voz con la que se leerá el texto

Este es un ejemplo sencillo de una solicitud:

Genera audio hablado a partir del texto de entrada
from pathlib import Path
from openai import OpenAI

client = OpenAI()
speech_file_path = Path(__file__).parent / "speech.mp3"

with client.audio.speech.with_streaming_response.create(
    model="gpt-4o-mini-tts",
    voice="coral",
    input="Today is a wonderful day to build something people love!",
    instructions="Speak in a cheerful and positive tone.",
) as response:
    response.stream_to_file(speech_file_path)

De forma predeterminada, el punto de acceso genera un MP3 del audio hablado, pero puedes configurarlo para que genere cualquier formato compatible.

Modelos de texto a voz

Para aplicaciones inteligentes en tiempo real, usa el modelo gpt-4o-mini-tts, nuestro modelo de texto a voz más reciente y confiable. Puedes darle instrucciones mediante prompts para controlar aspectos del habla, como:

  • Acento
  • Rango emocional
  • Entonación
  • Imitaciones
  • Velocidad del habla
  • Tono
  • Susurros

Nuestros otros modelos de texto a voz son tts-1 y tts-1-hd. El modelo tts-1 ofrece una latencia menor, pero con una calidad inferior a la del modelo tts-1-hd.

Opciones de voz

El punto de acceso TTS ofrece 13 voces integradas para controlar cómo se genera la voz a partir del texto. Escucha y experimenta con estas voces en OpenAI.fm, nuestra demostración interactiva para probar el modelo de texto a voz más reciente de la API de OpenAI. Actualmente, las voces están optimizadas para el inglés.

  • alloy
  • ash
  • ballad
  • coral
  • echo
  • fable
  • nova
  • onyx
  • sage
  • shimmer
  • verse
  • marin
  • cedar

Para obtener la mejor calidad, recomendamos usar marin o cedar.

La disponibilidad de voces depende del modelo. Los modelos tts-1 y tts-1-hd admiten un conjunto más reducido: alloy, ash, coral, echo, fable, onyx, nova, sage y shimmer.

Si usas la Realtime API, ten en cuenta que el conjunto de voces disponibles es ligeramente diferente. Consulta la guía de conversaciones en tiempo real para conocer las voces disponibles actualmente para uso en tiempo real.

Streaming de audio en tiempo real

La API de voz admite streaming de audio en tiempo real mediante codificación de transferencia por bloques. Esto significa que el audio puede reproducirse antes de que se genere el archivo completo y esté disponible.

Transmite audio hablado a partir del texto de entrada directamente a tus altavoces
import asyncio

from openai import AsyncOpenAI
from openai.helpers import LocalAudioPlayer

openai = AsyncOpenAI()


async def main() -> None:
    async with openai.audio.speech.with_streaming_response.create(
        model="gpt-4o-mini-tts",
        voice="coral",
        input="Today is a wonderful day to build something people love!",
        instructions="Speak in a cheerful and positive tone.",
        response_format="pcm",
    ) as response:
        await LocalAudioPlayer().play(response)


if __name__ == "__main__":
    asyncio.run(main())

Para obtener los tiempos de respuesta más rápidos, recomendamos usar wav o pcm como formato de respuesta.

Formatos de salida compatibles

El formato de respuesta predeterminado es mp3, pero también hay otros formatos disponibles, como opus y wav.

  • MP3: el formato de respuesta predeterminado para casos de uso generales.
  • Opus: para streaming y comunicación por internet, con baja latencia.
  • AAC: para compresión de audio digital, el formato preferido de YouTube, Android e iOS.
  • FLAC: para compresión de audio sin pérdida, el formato preferido de los aficionados al audio para archivar grabaciones.
  • WAV: audio WAV sin comprimir, adecuado para aplicaciones de baja latencia, ya que evita el procesamiento adicional de la decodificación.
  • PCM: similar a WAV, pero contiene las muestras sin procesar a 24 kHz (16 bits con signo, low-endian), sin encabezado.

Idiomas compatibles

En general, el modelo TTS admite los mismos idiomas que el modelo Whisper. Whisper admite los siguientes idiomas y ofrece buenos resultados, aunque las voces están optimizadas para el inglés:

Afrikáans, árabe, armenio, azerbaiyano, bielorruso, bosnio, búlgaro, catalán, chino, croata, checo, danés, neerlandés, inglés, estonio, finés, francés, gallego, alemán, griego, hebreo, hindi, húngaro, islandés, indonesio, italiano, japonés, canarés, kazajo, coreano, letón, lituano, macedonio, malayo, maratí, maorí, nepalí, noruego, persa, polaco, portugués, rumano, ruso, serbio, eslovaco, esloveno, español, suajili, sueco, tagalo, tamil, tailandés, turco, ucraniano, urdu, vietnamita y galés.

Puedes generar audio hablado en estos idiomas proporcionando texto de entrada en el idioma que elijas.

Voces personalizadas

Crea una voz personalizada aprobada a partir de una grabación del consentimiento de un hablante y una muestra de audio correspondiente. Consulta Voces personalizadas para conocer los criterios de elegibilidad, los requisitos de grabación, las frases de consentimiento y las solicitudes a la API.

Crear una voz

Sigue las instrucciones de Crear una voz personalizada.

Usar una voz durante la generación de voz

Pasa el ID de la voz creada al generar voz. Consulta los ejemplos de generación de voz.

Descripción general de tiempo real y audio

Elige la opción adecuada para agentes de voz, traducción, transcripción y generación de voz.

Conceptos de audio y voz

Revisa las modalidades de audio, las tareas de voz, el streaming y las API basadas en solicitudes.