Whisper
默认
通用语音识别模型
通用语音识别模型
性能
一般
速度
中
价格
$0.006
费用
输入
音频
输出
文本
Whisper 是一款通用语音识别模型,使用包含多种音频的大型数据集训练而成。您也可以将其用作多任务模型,执行多语言语音识别、语音翻译和语种识别。
定价
费用根据使用的 Token 数量计算,也可能根据模型类型采用其他计量方式。对于搜索和计算机使用等专用工具模型,每次工具调用均收取费用。详情请参阅定价页面。
定价
用例 / 1M 个 Token
Transcription
费用 / 分钟
$0.006
模态
文本
仅输出
图像
不支持
音频
仅输入
视频
不支持
端点
实时
v1/live/sessions
Chat Completions
v1/chat/completions
Responses
v1/responses
Realtime
v1/realtime
实时翻译
v1/realtime/translations
实时转录
v1/realtime/transcription_sessions
Assistants
v1/assistants
批处理
v1/batch
微调
v1/fine-tuning
嵌入向量
v1/embeddings
图像生成
v1/images/generations
视频
v1/videos
图像编辑
v1/images/edits
语音生成
v1/audio/speech
转录
v1/audio/transcriptions
翻译
v1/audio/translations
内容审核
v1/moderations
Completions(旧版)
v1/completions
快照
快照可让您锁定模型的特定版本,使其性能和行为保持一致。以下列出了 Whisper 的所有可用快照和别名。
whisper-1
whisper-1
whisper-1
速率限制
速率限制通过对特定时间段内的请求数、Token 数、音频时长或其他用量设置具体上限,确保 API 访问的公平性和可靠性。您的用量层级决定了这些上限的高低,并会随着请求数量和 API 支出的增加而自动提升。
| 层级 | RPM | RPD |
|---|---|---|
| 免费 | 3 | 200 |
| 层级 1 | 500 | - |
| 层级 2 | 2,500 | - |
| 层级 3 | 5,000 | - |
| 层级 4 | 7,500 | - |
| 层级 5 | 10,000 | - |