For the complete documentation index, see llms.txt. Markdown versions of documentation pages are available by appending .md to the page URL.
主导航

转录

为已录制音频或实时音频选择合适的工作流程。

转录将语音转换为文本。请根据音频是已录制完成还是正在实时传入,选择相应的工作流程。每种工作流程都有一个推荐的入门模型。

选择转录工作流程

工作流程 适用场景 推荐模型
文件转录

您有已录制完成的音频,或范围明确的音频请求。上传文件后接收最终转录文本,也可以在处理文件时以流式方式接收文本。

gpt-transcribe

实时转录

您有来自麦克风、通话或其他来源的实时音频流,需要在语音传入时获取文本。

gpt-live-transcribe

是否流式输出与是否使用实时音频是两个独立的选择。您可以流式接收已录制完成的文件的转录文本,无需开启 Realtime 会话。只有在音频实时传入或需要持久连接时,才使用 Realtime。

选择专项功能

请先使用适合您工作流程的推荐模型。只有在应用需要默认模型不具备的功能时,才切换模型。

如果您需要请使用
带有说话人标签的转录文本使用 gpt-4o-transcribe-diarize 进行文件转录
词级时间戳或 srtvtt 字幕使用 whisper-1 进行文件转录
将已录制完成的音频翻译成英语通过音频翻译端点使用 whisper-1
检测到的输入语言使用 gpt-transcribe 进行文件转录
通过 WebSocket 转录已提交的轮次使用 gpt-transcribe 进行实时转录

现有集成可以在受支持的场景中继续使用 gpt-4o-transcribegpt-4o-mini-transcribegpt-realtime-whisper。对于新的转录集成,不建议从这些模型开始。

请参阅转录定价,并在迁移生产环境流量之前,使用有代表性的音频测试推荐方案。

提高转录质量

gpt-transcribegpt-live-transcribe 接受三类上下文:

  • prompt:以自由文本形式描述录音的上下文,例如主题或场景。
  • keywords:音频中可能出现的具体词语,例如产品名称、药品名称或首字母缩略词。
  • languages:当录音可能包含多种语言时,提供预期输入语言的列表。

这些输入仅用于提供与音频相关的上下文,请勿重复描述转录任务。关键词只是提示,并非必须输出的内容。只有当音频中出现某个关键词时,转录文本才应包含该词。

这些模型使用 languages 字段,而非单数形式的 language 字段。接受单一语言提示的现有转录模型继续使用 language

gpt-transcribe 在 Realtime API 会话中转录输入音频,或在专用转录会话中运行时,它会自动将此前已转录的轮次用作上下文。

使用有代表性的音频进行测试

请在应用将会遇到的音频条件下测试转录效果,包括:

  • 目标语言、口音以及语言混用模式。
  • 背景噪声、麦克风质量和电话音频。
  • 名称、数字、日期、字母数字字符串和领域术语。
  • 简短话语、长录音和被打断的语音。

请跟踪对应用有实际影响的错误,而不要仅依赖词错误率。例如,在医疗保健工作流程中测试药品名称,或在客服工作流程中测试订单号。

后续步骤