For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
Navigation principale

Transcription

Choisissez le workflow adapté à l’audio enregistré ou en direct.

La transcription convertit la parole en texte. Choisissez un workflow selon que votre audio est déjà enregistré ou arrive en direct. Chaque workflow propose un modèle recommandé pour commencer.

Choisissez un workflow de transcription

Workflow Quand l’utiliser Modèle recommandé
Transcription de fichiers

Vous disposez d’un enregistrement terminé ou d’une requête portant sur un segment audio délimité. Envoyez le fichier pour recevoir une transcription finale, ou recevez le texte en streaming pendant le traitement du fichier.

gpt-transcribe

Transcription en temps réel

Vous disposez d’un microphone, d’un appel ou d’un autre flux audio en direct et avez besoin du texte au fur et à mesure que la parole arrive.

gpt-live-transcribe

Le streaming du texte et l’audio en direct sont deux choix distincts. Vous pouvez recevoir en streaming la transcription d’un fichier terminé sans ouvrir de session Realtime. Utilisez Realtime uniquement lorsque votre audio arrive en direct ou que vous avez besoin d’une connexion persistante.

Choisissez une fonctionnalité spécialisée

Commencez avec le modèle recommandé pour votre workflow. Ne changez de modèle que si votre application nécessite une fonctionnalité que le modèle par défaut ne propose pas.

Si vous avez besoin deUtilisez
Transcriptions avec identification des locuteursgpt-4o-transcribe-diarize avec la transcription de fichiers.
Horodatage des mots ou sous-titres srt et vttwhisper-1 avec la transcription de fichiers.
Traduction en anglais d’un enregistrement terminéwhisper-1 avec le point de terminaison de traduction audio.
Langues détectées dans l’audio d’entréegpt-transcribe avec la transcription de fichiers.
Transcription des tours de parole validés via WebSocketgpt-transcribe avec la transcription en temps réel.

Les intégrations existantes peuvent continuer à utiliser gpt-4o-transcribe, gpt-4o-mini-transcribe ou gpt-realtime-whisper lorsque ces modèles sont pris en charge. Ce ne sont pas les modèles recommandés pour démarrer une nouvelle intégration de transcription.

Consultez les tarifs de transcription et testez l’approche recommandée avec des échantillons audio représentatifs avant d’y transférer le trafic de production.

Améliorez la qualité de la transcription

gpt-transcribe et gpt-live-transcribe acceptent trois types de contexte :

  • prompt : contexte libre sur l’enregistrement, comme son sujet ou le cadre dans lequel il a été réalisé.
  • keywords : termes exacts susceptibles d’apparaître dans l’audio, tels que des noms de produits, des noms de médicaments ou des acronymes.
  • languages : liste des langues attendues en entrée lorsque l’enregistrement peut contenir plusieurs langues.

Utilisez ces paramètres uniquement pour fournir un contexte pertinent pour l’audio ; ne reformulez pas la tâche de transcription. Les mots-clés sont des indications, pas des éléments obligatoires du résultat. La transcription ne doit inclure un mot-clé que s’il est présent dans l’audio.

Ces modèles utilisent languages au lieu du champ au singulier language. Les modèles de transcription existants qui acceptent une indication de langue unique continuent à utiliser language.

Lorsque gpt-transcribe transcrit l’audio d’entrée dans une session Realtime API ou s’exécute dans une session dédiée à la transcription, il utilise automatiquement les tours de parole déjà transcrits comme contexte.

Testez avec des échantillons audio représentatifs

Testez la transcription dans les conditions audio que votre application rencontrera. Incluez :

  • Les langues cibles, les accents et les alternances entre langues.
  • Le bruit de fond, la qualité des microphones et l’audio téléphonique.
  • Les noms, les nombres, les dates, les chaînes alphanumériques et la terminologie du domaine.
  • Les énoncés courts, les enregistrements longs et les interruptions de parole.

Suivez les erreurs qui ont un impact sur l’application au lieu de vous fier uniquement au taux d’erreur sur les mots. Par exemple, testez les noms de médicaments dans un workflow de santé ou les numéros de commande dans un workflow d’assistance.

Étapes suivantes