For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navigation principale

Synthèse vocale

Découvrez comment transformer du texte en une voix naturelle.

L’API Audio propose un point de terminaison speech basé sur notre modèle GPT-4o mini TTS de synthèse vocale. Il comprend 11 voix intégrées et permet de :

  • Lire un article de blog à voix haute
  • Produire de la parole dans plusieurs langues
  • Fournir une sortie audio en temps réel grâce au streaming

Voici un exemple de la voix alloy :

Nos politiques d’utilisation vous obligent à informer clairement les utilisateurs finaux que la voix de synthèse qu’ils entendent est générée par l’IA et n’est pas une voix humaine.

Démarrage rapide

Le point de terminaison speech accepte trois paramètres principaux :

  1. Le modèle que vous utilisez
  2. Le texte à convertir en audio
  3. La voix utilisée pour lire le texte

Voici un exemple de requête simple :

Générez de la parole à partir du texte fourni
from pathlib import Path
from openai import OpenAI

client = OpenAI()
speech_file_path = Path(__file__).parent / "speech.mp3"

with client.audio.speech.with_streaming_response.create(
    model="gpt-4o-mini-tts",
    voice="coral",
    input="Today is a wonderful day to build something people love!",
    instructions="Speak in a cheerful and positive tone.",
) as response:
    response.stream_to_file(speech_file_path)

Par défaut, le point de terminaison produit un fichier MP3 de la parole générée, mais vous pouvez le configurer pour utiliser n’importe quel format pris en charge.

Modèles de synthèse vocale

Pour les applications intelligentes en temps réel, utilisez le modèle gpt-4o-mini-tts, notre modèle de synthèse vocale le plus récent et le plus fiable. Vous pouvez lui donner des instructions par prompt pour contrôler différents aspects de la parole, notamment :

  • L’accent
  • La palette d’émotions
  • L’intonation
  • Les imitations
  • Le débit de parole
  • Le ton
  • Le chuchotement

Nos autres modèles de synthèse vocale sont tts-1 et tts-1-hd. Le modèle tts-1 offre une latence plus faible, mais une qualité inférieure à celle du modèle tts-1-hd.

Choix de la voix

Le point de terminaison TTS propose 13 voix intégrées pour contrôler le rendu vocal du texte. Écoutez et essayez ces voix sur OpenAI.fm, notre démonstration interactive permettant de tester le dernier modèle de synthèse vocale de l’API OpenAI. Les voix sont actuellement optimisées pour l’anglais.

  • alloy
  • ash
  • ballad
  • coral
  • echo
  • fable
  • nova
  • onyx
  • sage
  • shimmer
  • verse
  • marin
  • cedar

Pour obtenir la meilleure qualité, nous vous recommandons d’utiliser marin ou cedar.

Les voix disponibles dépendent du modèle. Les modèles tts-1 et tts-1-hd prennent en charge un ensemble plus restreint : alloy, ash, coral, echo, fable, onyx, nova, sage et shimmer.

Si vous utilisez la Realtime API, les voix disponibles sont légèrement différentes. Consultez le guide des conversations en temps réel pour connaître les voix actuellement disponibles en temps réel.

Streaming audio en temps réel

L’API Speech prend en charge le streaming audio en temps réel grâce à l’encodage de transfert par blocs. L’audio peut ainsi être lu avant que le fichier complet soit généré et rendu accessible.

Diffusez en streaming la parole générée à partir du texte fourni directement sur vos haut-parleurs
import asyncio

from openai import AsyncOpenAI
from openai.helpers import LocalAudioPlayer

openai = AsyncOpenAI()


async def main() -> None:
    async with openai.audio.speech.with_streaming_response.create(
        model="gpt-4o-mini-tts",
        voice="coral",
        input="Today is a wonderful day to build something people love!",
        instructions="Speak in a cheerful and positive tone.",
        response_format="pcm",
    ) as response:
        await LocalAudioPlayer().play(response)


if __name__ == "__main__":
    asyncio.run(main())

Pour obtenir les temps de réponse les plus courts, nous vous recommandons d’utiliser wav ou pcm comme format de réponse.

Formats de sortie pris en charge

Le format de réponse par défaut est mp3, mais d’autres formats comme opus et wav sont disponibles.

  • MP3 : format de réponse par défaut pour les cas d’utilisation courants.
  • Opus : pour le streaming et les communications sur Internet, avec une faible latence.
  • AAC : pour la compression audio numérique, privilégié par YouTube, Android et iOS.
  • FLAC : pour la compression audio sans perte, apprécié des audiophiles pour l’archivage.
  • WAV : audio WAV non compressé, adapté aux applications à faible latence pour éviter le traitement supplémentaire lié au décodage.
  • PCM : similaire au WAV, mais contient les échantillons bruts à 24 kHz (16 bits signés, petit-boutiste), sans en-tête.

Langues prises en charge

Les langues prises en charge par le modèle TTS sont globalement les mêmes que celles du modèle Whisper. Whisper prend en charge les langues suivantes et offre de bons résultats, même si les voix sont optimisées pour l’anglais :

Afrikaans, arabe, arménien, azerbaïdjanais, biélorusse, bosnien, bulgare, catalan, chinois, croate, tchèque, danois, néerlandais, anglais, estonien, finnois, français, galicien, allemand, grec, hébreu, hindi, hongrois, islandais, indonésien, italien, japonais, kannada, kazakh, coréen, letton, lituanien, macédonien, malais, marathi, maori, népalais, norvégien, persan, polonais, portugais, roumain, russe, serbe, slovaque, slovène, espagnol, swahili, suédois, tagalog, tamoul, thaï, turc, ukrainien, ourdou, vietnamien et gallois.

Vous pouvez générer de la parole dans ces langues en fournissant un texte dans la langue de votre choix.

Voix personnalisées

Créez une voix personnalisée approuvée à partir d’un enregistrement du consentement d’un locuteur et d’un échantillon audio correspondant. Consultez Voix personnalisées pour connaître les critères d’éligibilité, les exigences d’enregistrement, les phrases de consentement et les requêtes API.

Création d’une voix

Suivez les instructions de la section Créer une voix personnalisée.

Utilisation d’une voix lors de la génération de parole

Transmettez l’identifiant de la voix créée lors de la génération de parole. Consultez les exemples de génération de parole.

Vue d’ensemble de Realtime et de l’audio

Choisissez l’approche adaptée aux agents vocaux, à la traduction, à la transcription et à la génération de parole.

Concepts de l’audio et de la parole

Découvrez les modalités audio, les tâches liées à la parole, le streaming et les API basées sur des requêtes.