轉錄會將語音轉換為文字。請根據音訊是已錄製完成,還是即時傳入,選擇工作流程。每種工作流程都有一個建議優先使用的模型。
選擇轉錄工作流程
| 工作流程 | 適用情境 | 建議模型 |
|---|---|---|
| 檔案轉錄 | 你有已錄製完成的音訊,或範圍明確的音訊請求。上傳檔案後,即可取得最終轉錄文字,或在檔案處理期間以串流方式接收文字。 | gpt-transcribe |
即時轉錄 | 你有來自麥克風、通話或其他來源的即時音訊串流,且需要在語音傳入時取得文字。 | gpt-live-transcribe |
是否串流輸出與是否處理即時音訊,是兩個獨立的選擇。你可以串流接收已錄製完成檔案的轉錄文字,無須開啟 Realtime 工作階段。只有在音訊即時傳入或需要持續連線時,才使用 Realtime。
選擇專用功能
先使用工作流程的建議模型。只有在應用程式需要預設模型未提供的功能時,才切換模型。
| 如果你需要 | 請使用 |
|---|---|
| 標註說話者的轉錄文字 | gpt-4o-transcribe-diarize 搭配檔案轉錄。 |
逐字時間戳記,或 srt 與 vtt 字幕 | whisper-1 搭配檔案轉錄。 |
| 將已錄製完成的音訊翻譯成英文 | whisper-1 搭配音訊翻譯端點。 |
| 偵測到的輸入語言 | gpt-transcribe 搭配檔案轉錄。 |
| 透過 WebSocket 轉錄已提交的回合 | gpt-transcribe 搭配即時轉錄。 |
現有整合可在支援的情況下繼續使用 gpt-4o-transcribe、gpt-4o-mini-transcribe 或 gpt-realtime-whisper。建立新的轉錄整合時,不建議優先使用這些模型。
請參閱轉錄定價,並在遷移正式環境流量之前,使用具代表性的音訊測試建議的流程。
提升轉錄品質
gpt-transcribe 和 gpt-live-transcribe 接受三種上下文:
prompt:以自由格式描述錄音的上下文,例如主題或情境。keywords:音訊中可能出現的確切詞彙,例如產品名稱、藥品名稱或縮寫。languages:錄音可能包含多種語言時,預期輸入語言的清單。
這些輸入僅應用來提供與音訊相關的上下文,請勿重述轉錄任務。關鍵字只是提示,並非必須輸出的內容。只有音訊中確實出現某個關鍵字時,轉錄文字才應包含該字詞。
這些模型使用 languages,而非單數形式的 language 欄位。接受單一語言提示的現有轉錄模型仍使用 language。
當 gpt-transcribe 在 Realtime API 工作階段中轉錄輸入音訊,或在專用的轉錄工作階段中執行時,會自動將先前已轉錄的回合作為上下文。
使用具代表性的音訊進行測試
請在應用程式實際會遇到的音訊條件下測試轉錄,包含:
- 目標語言、口音,以及不同語言混用的模式。
- 背景噪音、麥克風品質及電話音訊。
- 名稱、數字、日期、英數字串及領域術語。
- 簡短話語、長時間錄音及中途被打斷的語音。
追蹤會影響應用程式的錯誤,不要只依賴詞錯誤率。例如,在醫療照護工作流程中測試藥品名稱,或在客服工作流程中測試訂單編號。