2026 年 7 月 15 日発行 · 参考価格、予算を立てる前に確認してください
これまでに見たすべての LLM コスト比較では、おそらくキャッシュが無視されています。これは間違いです。プロンプト キャッシュによってコスト ランキングが変わるからです。クロードは書き込み料を請求します。 OpenAIはそうではありません。 Gemini のコンテキスト キャッシュは、保存される 1 時間あたりのコストがかかります。ここからが本当の計算です。
| プロバイダー | キャッシュの種類 | キャッシュ書き込みコスト | キャッシュ読み取りコスト | キャッシュTTL | 最小トークン数 |
|---|---|---|---|---|---|
| 人間性(クロード) | プロンプトプレフィックスキャッシュ | 1.25×標準入力 | 0.10×標準入力 | 5分(延長可能) | 1,024 |
| OpenAI (GPT-4o) | 自動キャッシュ | 書き込み料はかかりません | 0.50×標準入力 | ~5分 | 1,024 |
| グーグル(双子座) | コンテキストキャッシュ | 書き込み料はかかりません | 0.25×標準入力 | 保存時間ごとに請求されます | 32,768 |
主な構造上の違い:
| モデル | $/1M を入力 | 出力 $/1M |
|---|---|---|
| クロード・ソネット 4 | $3.00 | $15.00 |
| GPT-4o | $2.50 | $10.00 |
| ジェミニ 2.5 プロ | $1.25 | $10.00 |
キャッシュなし: Gemini 2.5 Pro は入力価格が最も安い (1.25 ドル対 2.50 ドル対 3.00 ドル)。しかし、キャッシュが適用されると状況は変わります。
典型的な運用アプリ: 10,000 トークンのシステム プロンプト (指示 + コンテキスト + 例) があり、1 日あたり 500 件のリクエストを送信します。各リクエストでは、ユーザー入力の 300 トークンが追加され、400 トークンが返されます。
| モデル | 入力/要求 (10,300 トーク) | 出力/要求 (400 トーク) | 毎月 (15,000 要求) |
|---|---|---|---|
| GPT-4o | $0.02575 | $0.004 | $446 |
| クロード・ソネット 4 | $0.0309 | $0.006 | $550 |
| ジェミニ 2.5 プロ | $0.012875 | $0.004 | $255 |
10,000 トークンのシステム プロンプトがキャッシュされます。後続の各リクエストは、10,000 個のキャッシュされたトークン + 300 個の新しい入力トークンを読み取ります。
| モデル | キャッシュ読み取り/1M | 新規入力/1M | 毎月 | キャッシュなしとの比較 |
|---|---|---|---|---|
| GPT-4o (自動キャッシュ) | $1.25 | $2.50 | $204 | −$242 (−54%) |
| クロード ソネット 4 + キャッシュ | $0.30 | $3.00 | $117 | −$433 (−79%) |
| Gemini 2.5 Pro + コンテキスト キャッシュ | $0.3125 | $1.25 | 58ドル* | −197ドル (−77%) |
*Gemini コンテキスト キャッシュでは、保存されている 10,000 トークンに対して 4.50 ドル/時間も課金されます。 1 つのキャッシュ インスタンスを年中無休で実行する場合: +$3.24/月のストレージ コスト。以下別途追加。
最初のリクエストでは、Anthropic はキャッシュの書き込みに 1.25 倍の料金を請求します。 10,000 トークンのシステム プロンプトの場合、$3.00/1M: 最初のリクエストの費用は $0.0375 ですが、標準の $0.030 です。追加の $0.0075 は、わずか 1.14 回のキャッシュ ヒット後に回収されます。 1 日あたり 500 リクエストを実行している場合、その書き込みプレミアムは重要ではありません。大量かつ少量の使用の場合、追加料金がかかります。
Gemini のコンテキスト キャッシュでは、読み取りが 75% オフになります。これは最大の割引です。ただし、トラフィックに関係なく、保存されたコンテンツに対して時間単位で料金がかかります。 10,000 トークン キャッシュを 24 時間年中無休で実行する場合:
大規模なコンテキストのユースケース (コードベース アシスタント、ドキュメント分析) の場合、Gemini のストレージ コストによりキャッシュ割引の利点が損なわれる可能性があります。ジェミニが勝つと仮定する前に、両方の項を計算します。
| 使用事例 | 最良の選択 | 理由 |
|---|---|---|
| 大量のアプリ、大規模な固定システム プロンプト (> 2,000 トークン、> 200 要求/日) | クロード・ソネット 4 | 90% のキャッシュ割引 + ストレージ料金なし = 大規模な合計で最低額 |
| 変動するトラフィック、バースト的なリクエスト | GPT-4o | 書き込み手数料、保存手数料なし、自動 - 最も寛容 |
| 大量の非常に大規模なコンテキスト (>32,000 トークン) | ジェミニ 2.5 プロ | 75% のキャッシュ読み取り割引。入力の節約に比べてストレージコストが小さい |
| 少量 (1 日あたり 50 要求未満)、プロンプトが小さい | ジェミニ 2.0 フラッシュ | キャッシュの節約は最小限に抑えられます。 Flash の生の価格が勝つ |
| 開発/テスト、予測できない使用法 | GPT-4oミニ | 少量では最も安価。オーバーヘッドのない自動キャッシュ |
ユースケースに応じてキャッシュを備えたプロバイダーを比較するには:
または、弊社の コスト計算機 — トークン数を設定すると、結果に標準レートが反映されます (キャッシュはプロバイダーのインフラストラクチャに自動的に適用されます)。