HomeBlog › キャッシュ後の OpenAI vs Anthropic vs Gemini

プロンプト キャッシュ後の OpenAI vs Anthropic vs Gemini: 実質コストの違い (2026 年)

2026 年 7 月 15 日発行 · 参考価格、予算を立てる前に確認してください

これまでに見たすべての LLM コスト比較では、おそらくキャッシュが無視されています。これは間違いです。プロンプト キャッシュによってコスト ランキングが変わるからです。クロードは書き込み料を請求します。 OpenAIはそうではありません。 Gemini のコンテキスト キャッシュは、保存される 1 時間あたりのコストがかかります。ここからが本当の計算です。

キャッシュ メカニズム - 各プロバイダーの仕組み

プロバイダーキャッシュの種類キャッシュ書き込みコストキャッシュ読み取りコストキャッシュTTL最小トークン数
人間性(クロード)プロンプトプレフィックスキャッシュ1.25×標準入力0.10×標準入力5分(延長可能)1,024
OpenAI (GPT-4o)自動キャッシュ書き込み料はかかりません0.50×標準入力~5分1,024
グーグル(双子座)コンテキストキャッシュ書き込み料はかかりません0.25×標準入力保存時間ごとに請求されます32,768

主な構造上の違い:

基本価格 (キャッシュなし)

モデル$/1M を入力出力 $/1M
クロード・ソネット 4$3.00$15.00
GPT-4o$2.50$10.00
ジェミニ 2.5 プロ$1.25$10.00

キャッシュなし: Gemini 2.5 Pro は入力価格が最も安い (1.25 ドル対 2.50 ドル対 3.00 ドル)。しかし、キャッシュが適用されると状況は変わります。

シナリオ: 10,000 トークンのシステム プロンプト、500 リクエスト/日

典型的な運用アプリ: 10,000 トークンのシステム プロンプト (指示 + コンテキスト + 例) があり、1 日あたり 500 件のリクエストを送信します。各リクエストでは、ユーザー入力の 300 トークンが追加され、400 トークンが返されます。

キャッシュなしのコスト (毎月、15,000 リクエスト)

モデル入力/要求 (10,300 トーク)出力/要求 (400 トーク)毎月 (15,000 要求)
GPT-4o$0.02575$0.004$446
クロード・ソネット 4$0.0309$0.006$550
ジェミニ 2.5 プロ$0.012875$0.004$255

キャッシュ適用後のコスト (同じ 15,000 リクエスト/月)

10,000 トークンのシステム プロンプトがキャッシュされます。後続の各リクエストは、10,000 個のキャッシュされたトークン + 300 個の新しい入力トークンを読み取ります。

モデルキャッシュ読み取り/1M新規入力/1M毎月キャッシュなしとの比較
GPT-4o (自動キャッシュ)$1.25$2.50$204−$242 (−54%)
クロード ソネット 4 + キャッシュ$0.30$3.00$117−$433 (−79%)
Gemini 2.5 Pro + コンテキスト キャッシュ$0.3125$1.2558ドル*−197ドル (−77%)

*Gemini コンテキスト キャッシュでは、保存されている 10,000 トークンに対して 4.50 ドル/時間も課金されます。 1 つのキャッシュ インスタンスを年中無休で実行する場合: +$3.24/月のストレージ コスト。以下別途追加。

Wait — Claude is cheapest after caching? はい。この規模 (10,000 のシステム プロンプトで 15,000 リクエスト/月) では、キャッシュを備えた Claude Sonnet 4 の費用は月額 117 ドルですが、GPT-4o は月額 204 ドル、Gemini は月額約 61 ドルです。反復されるプレフィックスが大きい場合、90% のキャッシュ読み取り割引は、Claude の高い基本価格を圧倒します。

キャッシュ書き込みプレミアム (Anthropic のみ)

最初のリクエストでは、Anthropic はキャッシュの書き込みに 1.25 倍の料金を請求します。 10,000 トークンのシステム プロンプトの場合、$3.00/1M: 最初のリクエストの費用は $0.0375 ですが、標準の $0.030 です。追加の $0.0075 は、わずか 1.14 回のキャッシュ ヒット後に回収されます。 1 日あたり 500 リクエストを実行している場合、その書き込みプレミアムは重要ではありません。大量かつ少量の使用の場合、追加料金がかかります。

ジェミニのストレージコストの罠

Gemini のコンテキスト キャッシュでは、読み取りが 75% オフになります。これは最大の割引です。ただし、トラフィックに関係なく、保存されたコンテンツに対して時間単位で料金がかかります。 10,000 トークン キャッシュを 24 時間年中無休で実行する場合:

大規模なコンテキストのユースケース (コードベース アシスタント、ドキュメント分析) の場合、Gemini のストレージ コストによりキャッシュ割引の利点が損なわれる可能性があります。ジェミニが勝つと仮定する前に、両方の項を計算します。

キャッシュ後の新しいコストランキング

キャッシュなし: Gemini 2.5 Pro > GPT-4o > Claude Sonnet (最も安いものから最も高価なものまで)
キャッシュあり (大規模なシステム プロンプト、大量): ジェミニ ≈ クロード > GPT-4o (クロードが劇的に追いつく)
キャッシュあり (バースト、低ボリューム): GPT-4o > クロード > ジェミニ (OpenAI の書き込み手数料無料 + ストレージ手数料なしの勝ち)

「最も安い」プロバイダーは、トラフィック パターンとプロンプトの構造によって異なります。

それぞれのアプローチが成功するとき

使用事例最良の選択理由
大量のアプリ、大規模な固定システム プロンプト (> 2,000 トークン、> 200 要求/日)クロード・ソネット 490% のキャッシュ割引 + ストレージ料金なし = 大規模な合計で最低額
変動するトラフィック、バースト的なリクエストGPT-4o書き込み手数料、保存​​手数料なし、自動 - 最も寛容
大量の非常に大規模なコンテキスト (>32,000 トークン)ジェミニ 2.5 プロ75% のキャッシュ読み取り割引。入力の節約に比べてストレージコストが小さい
少量 (1 日あたり 50 要求未満)、プロンプトが小さいジェミニ 2.0 フラッシュキャッシュの節約は最小限に抑えられます。 Flash の生の価格が勝つ
開発/テスト、予測できない使用法GPT-4oミニ少量では最も安価。オーバーヘッドのない自動キャッシュ

計算式

ユースケースに応じてキャッシュを備えたプロバイダーを比較するには:

# キャッシュを使用した場合のプロバイダーごとの月額料金:
キャッシュトークン = your_system_prompt_tokens
new_tokens = user_message_tokens
出力トークン = 平均応答トークン
リクエスト = 毎日のリクエスト × 30

# OpenAI (自動、書き込み手数料なし):
月次 = リクエスト × (キャッシュトークン × キャッシュレート + 新しいトークン × 入力レート + 出力トークン × 出力レート) / 1_000_000

# Anthropic (明示的、最初の要求にプレミアムを書き込みます):
first_req = キャッシュトークン × (入力レート × 1.25) / 1_000_000 # プレミアムを書き込む
rest = (requests-1) × (cache_tokens × (input_rate × 0.10) + new_tokens × input_rate) / 1_000_000
出力コスト = リクエスト × 出力トークン × 出力レート / 1_000_000
毎月 = first_req + 残り + 出力コスト

または、弊社の コスト計算機 — トークン数を設定すると、結果に標準レートが反映されます (キャッシュはプロバイダーのインフラストラクチャに自動的に適用されます)。

参考価格、2026 年 7 月。キャッシュのメカニズムとレートは頻繁に変更されます。OpenAI、Anthropic、Google のドキュメントで確認してください。エラーが見つかりましたか? 報告する→