2026 年 7 月 15 日発行 · 参考価格、予算を立てる前に確認してください
私たちは 20 の実際の運用ワークロードを (それぞれ現実的なトークン数を使用して) 取得し、4 つのモデル層にわたって 1,000 リクエスト/日の価格を設定しました。同じタスクに対する最も安価なモデルと最も高価なモデルの差は次のとおりです。 100× またはそれ以上。
| モデル | $/1M を入力 | 出力 $/1M | 階層 |
|---|---|---|---|
| ジェミニ 2.0 フラッシュ 最安 | $0.10 | $0.40 | 小さい |
| GPT-4oミニ | $0.15 | $0.60 | 小さい |
| クロード俳句 4.5 | $0.80 | $4.00 | 小+ |
| GPT-4o | $2.50 | $10.00 | フロンティア |
| クロード・ソネット 4 | $3.00 | $15.00 | フロンティア |
月額コスト = リクエスト/日 × 30 × リクエストあたりのコスト。トークン数は一般的な値であり、実際の使用量は異なる場合があります。 電卓を使用する 正確な数字については。
| ワークロード | トークン (イン/アウト) | フラッシュ/月 | 4 分/月 | 俳句/月 | GPT-4o/mo |
|---|---|---|---|---|---|
| 電子メールの分類 | 100 / 20 | $0.54 | $0.81 | $4.80 | $18 |
| 感情分析 | 150 / 30 | $0.81 | $1.22 | $7.20 | $27 |
| ニュースの分類 | 60 / 10 | $0.30 | $0.45 | $2.70 | $10 |
| 検索クエリの書き換え | 80 / 60 | $0.95 | $1.44 | $9.00 | $34 |
| コンテンツモデレーション | 500 / 20 | $1.74 | $2.61 | $15.60 | $58 |
| ワークロード | トークン (イン/アウト) | フラッシュ/月 | 4 分/月 | 俳句/月 | GPT-4o/mo |
|---|---|---|---|---|---|
| メール返信の下書き | 300 / 400 | $5.76 | $8.55 | $54 | $202 |
| 製品説明 | 200 / 300 | $4.14 | $6.21 | $39.60 | $148 |
| ソーシャルメディアへの投稿 | 200 / 120 | $2.02 | $3.06 | $19.20 | $71 |
| よくある質問の回答 | 400 / 350 | $5.40 | $8.10 | $51.60 | $193 |
| ユーザーからのフィードバックの概要 | 600 / 200 | $4.20 | $6.30 | $38.40 | $142 |
| ワークロード | トークン (イン/アウト) | フラッシュ/月 | 4 分/月 | 俳句/月 | ソネット 4/月 |
|---|---|---|---|---|---|
| サポートチャットメッセージ | 500 / 300 | $5.10 | $7.65 | $48 | $180 |
| サポートチャット(履歴あり) | 2000 / 300 | $9.60 | $14.40 | $87.60 | $315 |
| 苦情エスカレーションの決定 | 800 / 100 | $3.60 | $5.40 | $33.60 | $126 |
コンテキストの成長は隠れたコストです。 会話履歴が蓄積されると、入力トークンが膨れ上がります。メッセージ 1 は 300 トークンになる可能性があります。同じチャット内のメッセージ 10 は 2,500 トークンになる可能性があります。これは、投入コストだけでも 8 倍の増加になります — 詳細を参照してください。 会話コストの増加を完全に分析.
| ワークロード | トークン (イン/アウト) | フラッシュ/月 | 4 分/月 | 俳句/月 | GPT-4o/mo |
|---|---|---|---|---|---|
| SQLクエリの生成 | 400 / 200 | $3.60 | $5.40 | $33.60 | $126 |
| コードレビューのコメント | 600 / 800 | $12.36 | $18.54 | $117.60 | $441 |
| バグ修正の説明 | 800 / 1000 | $14.40 | $21.60 | $138 | $516 |
| 単体テストの生成 | 600 / 1200 | $16.20 | $24.30 | $166.80 | $625 |
| ワークロード | トークン (イン/アウト) | フラッシュ/月 | 4 分/月 | 俳句/月 | GPT-4o/mo |
|---|---|---|---|---|---|
| RAG 回答 (3 チャンク) | 2000 / 400 | $10.80 | $16.20 | $102 | $381 |
| 文書の要約 | 4000 / 500 | $18 | $27 | $156 | $585 |
| 法的条項の抽出 | 8000 / 1000 | $35.60 | $54 | $336 | $1,260 |
| 請求書データの抽出 | 1000 / 300 | $6.60 | $9.90 | $58.80 | $220 |
コンテキスト サイズが大きい場合、 投入コストが支配的な項になる. With a legal document at 8,000 input tokens, Gemini Flash costs $35.60/month at 1k req/day — GPT-4o costs $1,260. For extraction tasks (structured output, well-defined schema), Flash and 4o-mini typically perform well. For open-ended reasoning over long docs, test quality carefully.
20 個のワークロードすべてにわたって、 単純な分類のために GPT-4o から Gemini Flash に切り替えると 95 ~ 97% 節約できます。長い出力 (単体テスト、バグ修正) を伴うコード生成では、節約率は依然として 97% です。絶対金額は異なります (ニュース分類の場合は月額 0.30 ドル、単体テストの場合は月額 625 ドル) ですが、乗数は一貫しています。
実際的な意味: すべてに 1 つのモデルを使用しないでください。品質が客観的に重要であるタスク (評価によって測定される) でフロンティア モデルを実行し、ベンチマークで一致することが示されている場合は、ルーティング、分類、抽出に小規模なモデルを使用します。
| タスクの種類 | 推奨レベル | 推論 |
|---|---|---|
| 分類/ルーティング | フラッシュまたは4o-mini | 出力品質はコストの 5% でしきい値を満たします |
| 短い世代 (<200 トークン) | フラッシュまたは4o-mini | 通常許容できる品質。最初にテストしてください |
| サポートチャット | フラッシュとか俳句とか | コンテキストのコストは急速に増大します。 Flash は音量で勝ります |
| SQL / コード (明確に定義された) | 4o-mini または俳句 | 構造化された出力に関しては Flash よりも優れています。フロンティアよりはるかに安い |
| 複雑な推論/コード | GPT-4o またはソネット 4 | 品質のギャップは現実のものであり、測定可能です。それに応じて予算を立てる |
| 長いコンテキストの抽出 | フラッシュまたは4o-mini | スキーマ駆動のタスクにはフロンティア推論は必要ありません |
| ロングコンテキスト分析 | GPT-4o または Gemini 2.5 Pro | 8,000 トークン以上のオープンエンド推論にはフロンティア機能が必要 |
上記はすべて、1 日あたり 1,000 リクエストを想定しています。直線的に拡張: 10,000 リクエスト/日 = コストの 10 倍。 100 リクエスト/日 = コストの 10%。私たちのを使用してください LLM コスト計算ツール または特定のモデルを比較する LLMの価格比較.