OpenAI モデルの利用コストを削減する方法はいくつかあります。コストとレイテンシは通常、互いに関連しており、トークン数やリクエスト数を減らすと、一般に処理も速くなります。OpenAI の Batch API や Flex 処理を利用することでもコストを削減できます。
コストとレイテンシ
レイテンシとコストを削減するには、次の方法を検討してください。
- リクエスト数の削減:タスクの完了に必要なリクエストの数を抑えます。
- トークン数の最小化:入力トークン数を減らし、モデルの出力が短くなるように最適化します。
- より小さいモデルの選択:コストとレイテンシの削減を、精度の維持と両立できるモデルを使用します。
これらの方法について詳しくは、レイテンシの最適化ガイドを参照してください。
Batch API
ジョブを非同期で処理します。Batch API は、使いやすい一連のエンドポイントを提供します。複数のリクエストを 1 つのファイルにまとめ、それらを実行するバッチ処理ジョブを開始し、リクエストの実行中にバッチのステータスを確認できます。バッチが完了したら、まとめて結果を取得できます。
Flex 処理
応答時間が長くなり、リソースが一時的に利用できない場合もありますが、その分、Chat Completions や Responses のリクエストにかかるコストを大幅に削減できます。モデルの評価、データの拡充、非同期ワークロードなど、本番環境以外でのタスクや優先度の低いタスクに最適です。