プロンプト キャッシュとは実際には何ですか
ほとんどの LLM アプリは、すべてのリクエストの開始時に同じテキスト ブロック (長いシステム プロンプト、一連のツール定義、いくつかのショットの例、または参照コンテキストの塊) を送信します。通常は全額支払います 入力トークン たとえそれが決して変わらないとしても、呼び出しごとにそのブロックの価格が変わります。
即時キャッシュ プロバイダーがその安定版を保存できるようにする 接頭語 最初の通話後、およびまったく同じテキストで始まるその後の通話では、通常料金のわずかな割合で請求されます。 10% (最大 90% 割引)。各呼び出しを変更する部分 (ユーザーの実際の質問) については引き続き全額を支払いますが、固定オーバーヘッドはほぼ無料になります。
即時キャッシュ節約計算ツール →プロバイダー間での仕組み
大きく分けて 2 つのフレーバーがあり、その違いが請求額に影響します。
明示的なキャッシュ (例: Anthropic)
キャッシュ可能なプレフィックスが終了する位置をマークします。最初の電話 書きます キャッシュと少しコストがかかります もっと 通常の入力トークンよりも — 一般的には約 1.25× 入力レート — プロバイダーは処理されたプレフィックスを保存する必要があるためです。それを再利用するその後の呼び出しはすべて、 キャッシュ読み取り、およそで請求されます 0.1× 入力レート。キャッシュには、 生存時間 (TTL) 多くの場合は数分ですが、ヒットするたびに更新されるため、安定したトラフィックの流れによって暖かさが保たれます。
自動キャッシュ (OpenAI など)
プロバイダーはプレフィックスの繰り返しを検出し、キャッシュ書き込みプレミアムやコード変更なしの割引を適用します。これは単純ですが、制御が少なくなります。キャッシュの有効期間を強制することはできず、割引と資格のルールはプロバイダーによって設定されます (通常、プレフィックスが最小長を超えると開始されます)。
| 明示的キャッシュ | 自動キャッシュ | |
|---|---|---|
| 何をキャッシュするかを誰が決定するか | あなた(接頭辞をマークしてください) | プロバイダー (リピートを検出) |
| キャッシュ書き込みコスト | 最大 1.25 倍の入力、1 回 | なし |
| キャッシュ読み取りコスト | ~0.1×入力 | 割引(プロバイダーセット) |
| TTLの制御 | はい | いいえ |
乗数は一般的に公開されている値であり、モデルやプロバイダーによって異なります。常にプロバイダーの価格ページで確認してください。
書き込みと読み取りのトレードオフ — それが報われるとき
明示的キャッシュを使用すると、書き込みに少額の 1 回限りのプレミアムを支払い、その後は読み取りごとに大幅な割引が適用されます。したがって、一度キャッシュを利用すれば効果が得られます。 書き込みコストを相殺するのに十分な回数プレフィックスを再利用する。損益分岐点は早いです。書き込みプレミアムはわずか約 0.25 倍の追加入力であり、各読み取りで約 0.9 倍の入力が節約されます。つまり、おおよその処理で優位に立つことができます。 2回の再利用 同じプレフィックスの。その後、すべてのヒットはほぼ純粋な貯蓄になります。
キャッシュを確実に成功させる要素は次のとおりです。
- 大きく繰り返されるプレフィックス — 固定トークンが多いほど、絶対的な割引額は大きくなります。
- 通話量が多い — 多くのリクエストは、TTL ウィンドウ内で同じプレフィックスを共有します。
- 安定したプレフィックス — 再利用されたブロックは、呼び出しごとにバイトごとに同一です。
検索拡張アプリ、大きなシステム プロンプトを備えたコーディング アシスタント、およびマルチターン チャットはすべてこの形状に適合します。より広範な戦術については、 LLM API の料金を削減するためのガイド.
うまくいった例
持っていると言ってください 2,000 トークンのシステム プロンプト (手順 + ツール定義 + いくつかの例) これはすべてのリクエストで実行され、次のようになります。 100,000 回の通話。投入価格を次のように仮定します。 100万トークンあたり3ドル、キャッシュ読み取りレートは 0.1 倍 ($0.30/M)、キャッシュ書き込みレートは 1.25 倍 ($3.75/M) です。キャッシュによってこれらは変更されないため、コールごとのユーザーの質問と出力は無視します。
キャッシュなし
すべての通話で、2,000 プレフィックス トークンすべての全額が支払われます。
100,000 × 2,000 = 200,000,000 トークン × 3 ドル/月 = $600.
キャッシングあり
プレフィックスは 1 回書き込まれ、他の 99,999 回の呼び出しで読み取られます (実際には、TTL が経過するたびに再書き込みされますが、トラフィックは無視できるほど安定しています)。
- 1 回の書き込み: 2,000 トークン × $3.75/M ≈ $0.0075
- 99,999 読み取り: ~200,000,000 トークン × 0.30 ドル/M ≈ $60
合計 ≈ $60 対 600 ドル — ~90%カット 請求書の繰り返し部分については、プレフィックスが終了する位置をマークする 1 行の料金で。実際のワークロードでは、プレフィックスが大きくなり、呼び出しの頻度が高くなることが多いため、絶対的な節約効果はさらに大きくなります。
トークンコスト計算ツール →節約額を見積もる →注意すべき落とし穴
- 変更部分の前はすべて同一である必要があります。 キャッシュは正確なプレフィックスに基づいて一致します。タイムスタンプ、ユーザー名、または上部近くのシャッフルされた注文例は一致を無効にし、黙って全額を支払います。
- TTL の有効期限が切れています。 トラフィックがまばらで、呼び出し間のギャップがキャッシュの有効期間を超える場合、プレフィックスは期限切れになり、次の呼び出しで書き込みコストが再度支払われます。集中的で少量のワークロードのメリットはほとんどありません。
- 小さなプレフィックスには価値がありません。 プロバイダーのキャッシュ可能な最小長を下回る場合、または固定ブロックが数百トークンのみである場合、節約できる量はわずかであり、書き込みプレミアムにより若干の悪影響が生じる可能性があります。
- 安定したものを最初に置きます。 プロンプトを構造化することで、不変のシステム プロンプト、ツール、コンテキストが揮発性のユーザー入力の前に来るようにします。キャッシュは、同一のトークンの先頭の実行のみをカバーできます。
よくある質問
プロンプト キャッシュによりどれくらい節約できますか?
キャッシュ読み取りの場合、ほとんどのプロバイダーは、キャッシュされたトークンに対して通常の入力レートの約 10% で請求します。これは、プロンプトの繰り返し部分の 90% 割引です。正確な数値はプロバイダーによって異なりますが、多くの通話で再利用される大きくて安定したプレフィックスにより、節約が最大になります。
プロンプト キャッシュの設定には追加料金がかかりますか?
明示的なキャッシュ (Anthropic など) では、キャッシュを書き込む最初の呼び出しのコストが通常の入力トークンよりわずかに高くなります (通常、入力レートの約 1.25 倍)。プレフィックスを数回再利用するとすぐに書き込みプレミアムが回復し、その後はすべてのヒットが大幅に割引された読み取り料金で請求されます。
プロンプト キャッシュが価値がないのはどのような場合ですか?
キャッシュは、大きなプレフィックスが呼び出し全体で同一であり、キャッシュが期限切れになる前に再利用される場合にのみ役立ちます。短いプレフィックス、呼び出しごとに変更されるプロンプト、または呼び出し量が少ない場合は、書き込みコストが決して回収されないことを意味します。そのような場合、キャッシュはコストを節約する代わりにオーバーヘッドを追加します。
教育上の参考のみ - キャッシュ レート、TTL、最小長は推定値です。各プロバイダーの料金ページで現在の条件を確認してください。