2026 年 6 月 21 日公開 · 参照番号、予算編成前に確認してください
アプリが通話ごとに同じ長いシステム プロンプト、同じ取得したドキュメント、または増え続ける同じチャット履歴を送信する場合、モデルが数秒前にすでに見たテキストを再読するために全額を支払っていることになります。 即時キャッシュ これは修正であり、ほとんどのチームが決して有効にしない単一の項目の最大の割引です。正しく実行すると、投入コストが次のように削減されます。 50%~90%。それがどのように機能するか、2026 年の数字、そしてそれが静かに役に立たない場所は次のとおりです。
LLM 請求書のほとんどは、 入力トークン × 価格 + 出力トークン × 価格。キャッシングは入力半分を攻撃します。プロンプトのチャンクをキャッシュ可能としてマークすると、プロバイダーは処理されたフォームを短いウィンドウ内に保存します。まったく同じプレフィックスを再利用する次回の通話では、 分数 それらのトークンの全額ではなく、通常の入力レートの。出力価格は変更されません。キャッシュでは、再送信し続ける部分のみが割引されます。
| プロバイダー | キャッシュされた入力価格 | 注意事項 |
|---|---|---|
| OpenAI | 入力の ~50% | 長いプロンプトでは自動、コード変更なし |
| 人間性(クロード) | 読み取り時の入力の最大 10% | 最大 90% オフ — ただし、初回書き込みプレミアムは最大 25% です |
| Google ジェミニ | 入力の最大 25% | コンテキストのキャッシュ。少額の保管料が追加される場合があります |
サポート アシスタントが 2,000 トークンのシステム プロンプト + ナレッジ ベース すべてのメッセージに加えて、ユーザーの実際の質問の最大 200 トークンが含まれ、最大 300 の出力トークンが返されます。月に 10,000 件の会話がある場合、固定の 2,000 トークン ブロックが 10,000 回再送信されます。 $2.50 / 1M 入力のモデルを使用する場合:
これを 100,000 または 1M の会話に拡張すると、静的プレフィックスが快適な料金と憂慮すべき料金の違いになります。固定コンテキストが大きくなり、繰り返されるほど、キャッシュの価値は高くなります。RAG アプリとシステム プロンプトが長いエージェントが最もメリットをもたらします。
システム プロンプト、ツール定義、RAG ドキュメント、数ショットの例、長いチャット履歴など、大規模で同一のコンテキスト ブロックを頻繁かつ迅速に再送信するときにキャッシュします。 1 回限りの呼び出し、非常に変わりやすいプロンプト、または出力の多いワークロードを気にする必要はありません。プロンプトを構成する 静的が先、変数が最後、そして割引は無料に近い金額です。自分のケースに番号を付けてください プロンプトキャッシュ節約計算ツールでモデルを比較します。 AI API コスト計算ツール.
プロバイダーによって異なりますが、通常、キャッシュされた部分の入力価格から 50 ~ 90% 割引になります。繰り返される入力トークンのみが割引され、出力は割引されません。
いいえ、これは請求/遅延の最適化です。モデルは同じトークンを認識するため、キャッシュされたプレフィックスを再送信するための料金が安くなるだけです。応答は変わりません。
ほとんどの場合、有効期限が切れる前に十分に再利用されないプレフィックス、またはヒットしないようにすべての呼び出しを変更するプレフィックスには、書き込みプレミアム (例: Anthropic のキャッシュ作成に対する最大 25% の追加料金) がかかります。キャッシュは、同じ内容を頻繁に再利用することで効果を発揮します。
参考見積もり — プロバイダーの公式料金ページで割引と料金を必ず確認してください。