La transcripción convierte la voz en texto. Elige un flujo de trabajo según si el audio ya está grabado o llega en vivo. Cada flujo de trabajo tiene un modelo recomendado para comenzar.
Elige un flujo de trabajo de transcripción
| Flujo de trabajo | Cuándo usarlo | Modelo recomendado |
|---|---|---|
| Transcripción de archivos | Tienes una grabación completa o una solicitud de audio acotada. Sube el archivo y recibe una transcripción final, o recibe el texto en streaming mientras se procesa el archivo. | gpt-transcribe |
Transcripción en tiempo real | Tienes un micrófono, una llamada u otra fuente de audio en vivo y necesitas texto a medida que llega la voz. | gpt-live-transcribe |
Recibir la salida en streaming y usar audio en vivo son decisiones independientes. Puedes recibir en streaming la transcripción de un archivo completo sin abrir una sesión de Realtime. Usa Realtime solo cuando el audio llegue en vivo o necesites una conexión persistente.
Elige una capacidad especializada
Comienza con el modelo recomendado para tu flujo de trabajo. Cambia de modelo solo cuando tu aplicación requiera una capacidad que el modelo predeterminado no ofrezca.
| Si necesitas | Usa |
|---|---|
| Transcripciones con etiquetas de hablante | gpt-4o-transcribe-diarize con transcripción de archivos. |
Marcas de tiempo por palabra o subtítulos srt y vtt | whisper-1 con transcripción de archivos. |
| Traducción al inglés de una grabación completa | whisper-1 con el punto de acceso de traducciones de audio. |
| Idiomas de entrada detectados | gpt-transcribe con transcripción de archivos. |
| Transcripción de turnos confirmados mediante WebSocket | gpt-transcribe con transcripción en tiempo real. |
Las integraciones existentes pueden seguir usando gpt-4o-transcribe, gpt-4o-mini-transcribe o gpt-realtime-whisper donde sean compatibles. Estos no son los modelos recomendados para comenzar una nueva integración de transcripción.
Consulta los precios de transcripción y prueba la opción recomendada con audio representativo antes de migrar el tráfico de producción.
Mejora la calidad de la transcripción
gpt-transcribe y gpt-live-transcribe aceptan tres tipos de contexto:
prompt: contexto en formato libre sobre la grabación, como su tema o entorno.keywords: términos literales que pueden aparecer en el audio, como nombres de productos, medicamentos o siglas.languages: una lista de los idiomas de entrada esperados cuando la grabación pueda contener más de un idioma.
Usa estas entradas solo para aportar contexto relevante para el audio; no repitas la tarea de transcripción. Las palabras clave sirven de orientación y no tienen que aparecer en la salida. La transcripción debe incluir una palabra clave solo cuando esté presente en el audio.
Estos modelos usan languages en lugar del campo en singular language. Los modelos de transcripción existentes que aceptan una indicación de un solo idioma siguen usando language.
Cuando gpt-transcribe transcribe el audio de entrada en una sesión de Realtime API o se ejecuta en una sesión dedicada a la transcripción, usa automáticamente los turnos transcritos anteriores como contexto.
Prueba con audio representativo
Prueba la transcripción en las condiciones de audio que encontrará tu aplicación. Incluye:
- Los idiomas previstos, los acentos y los patrones de alternancia entre idiomas.
- Ruido de fondo, calidad del micrófono y audio telefónico.
- Nombres, números, fechas, cadenas alfanuméricas y terminología del área.
- Enunciados breves, grabaciones largas y habla interrumpida.
Haz un seguimiento de los errores relevantes para la aplicación en lugar de basarte únicamente en la tasa de error de palabras. Por ejemplo, prueba nombres de medicamentos en un flujo de trabajo de atención médica o números de pedido en un flujo de trabajo de soporte.