For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navigation principale

Audio et voix

Commencez avec GPT-Live pour les conversations vocales, ou choisissez une API pour une autre tâche audio.

Pour créer une application de conversation vocale, commencez avec GPT-Live. Il peut écouter tout en parlant et poursuivre la conversation pendant qu’un agent côté serveur raisonne, utilise des outils ou accomplit une tâche.

Établissez votre première conversation à l’aide du guide de démarrage rapide WebRTC, puis rédigez un court prompt pour Live. Si vous disposez déjà d’une application Realtime ou d’un agent textuel, suivez le guide Migrez vers GPT-Live.

Choisissez un autre workflow audio

Utilisez Realtime API lorsque vous avez besoin de son modèle de gestion des sessions et des outils. Pour la transcription, la traduction ou la génération de parole sans agent conversationnel, choisissez l’API dédiée ci-dessous.

Ce que vous souhaitez créerPar où commencerCe que vous contrôlez
Un agent parole à parole utilisant le modèle de gestion des sessions et des outils de RealtimeRealtime APILes tours de parole, l’état de la session, les outils et les interruptions.
Une interface vocale pour un agent textuel existantAgents vocauxLa transcription de la parole en texte, le workflow de l’agent textuel, puis la synthèse vocale.
La transcription d’un fichier audioTranscription de fichiersLes envois de fichiers, les requêtes de portée limitée et les formats de transcription pris en charge.
Des sous-titres en direct sans prise de parole de l’assistantTranscription en directL’audio en continu et les événements de transcription incrémentale.
La traduction de la parole en continuTraduction en directUne session dédiée à la traduction, et non une boucle de tours de parole avec un agent vocal.
Une narration ou de la parole généréeSynthèse vocaleLe texte, la voix et le format de sortie.
Des entrées ou sorties audio dans une application de discussion existanteAudio dans Chat CompletionsDes requêtes de discussion multimodales de portée limitée.

Développez avec la voix

Consultez le guide Agents vocaux pour comparer les architectures. Commencez par le guide de conception de prompts pour GPT-Live ou Realtime. Consultez ensuite les guides communs sur les voix personnalisées, l’évaluation et l’optimisation des coûts. Chaque guide précise les comportements propres à chaque modèle ou API.

Choisissez une connexion

Pour l’audio dans le navigateur, commencez avec WebRTC. Pour les pipelines audio côté serveur, utilisez WebSockets. Pour les appels téléphoniques, consultez Téléphonie et SIP. Une connexion de contrôle côté serveur permet à un backend de confiance d’observer et de contrôler une session multimédia.

Sélectionnez votre API sur chaque page consacrée à la connexion. L’utilisation d’un même transport ne rend pas interchangeables les procédures de négociation, les identifiants d’authentification ou les formats d’événements de GPT-Live et de Realtime. Consultez le guide de connexion pour connaître les prérequis et les instructions de configuration.

Ajoutez l’audio à votre application existante

Les exemples Chat Completions se trouvent désormais dans Audio dans Chat Completions. Pour créer votre premier agent vocal dans le navigateur, utilisez le guide de démarrage rapide WebRTC pour GPT-Live.