LLM API の使用法

キャッシュコスト

メトリック キャッシュなし キャッシュあり

セマンティック キャッシュの仕組み

すべての受信クエリは埋め込みベクトルに変換されます。キャッシュは、類似したベクトルが存在するかどうかをチェックします (コサイン類似度 ≥ しきい値、通常は 0.92 ~ 0.97)。 「はい」の場合、保存された応答が即座に返され、LLM トークンは消費されません。 「いいえ」の場合、クエリは LLM に送られ、結果は今後のヒットに備えて保存されます。

ヒット率の由来: 反復的なクエリ (FAQ ボット、カスタマー サポート) は 30 ~ 60% です。多様な自由形式のクエリ (コーディング アシスタント、クリエイティブ ライティング) は 5 ~ 15% です。類似性のしきい値を下げることでヒット率を高めることができますが、キャッシュされたわずかに間違った回答が提供される危険があります。

埋め込みコスト: すべてのクエリ (ヒットまたはミス) には埋め込みルックアップが必要です。 100 万トークンあたり 0.02 ドルの場合、300 トークンのクエリを埋め込む場合のコストは 0.000006 ドルで、1 日に何百万ものクエリがある場合を除き、無視できる金額です。

以下も参照してください。 即時キャッシュによる節約 · RAG コスト計算ツール · ベクトル DB コスト

よくある質問

LLM のセマンティック キャッシュとは何ですか?

セマンティック キャッシュは以前の LLM 応答を保存し、埋め込み類似性を使用してセマンティックに類似したクエリを検出します。類似性がしきい値を超えている場合、LLM を呼び出すことなくキャッシュされた回答が返され、そのクエリのトークン コスト全体が節約されます。

どのくらいのキャッシュ ヒット率が現実的ですか?

繰り返しの質問を行うカスタマー サポート ボットのヒット率は 30 ~ 60% であることがよくあります。オープンエンドのチャットボットやコーディングアシスタントは 5 ~ 15% になる可能性があります。適切な類似性しきい値 (0.92 ~ 0.97 コサイン) は、ヒット率と品質の低下のバランスをとります。

損益分岐点達成率とは何ですか?

損益分岐点 = キャッシュコスト ÷ (クエリ/月 × トークン × LLM 価格/トークン)。 LLM のコストが 1 クエリあたり 0.003 ドルで、キャッシュのコストが 100,000 クエリ/月で 50 ドル/月の場合、損益分岐点に必要なヒット率は 1.7% だけです。

セマンティック キャッシュはプロンプト キャッシュとどう違うのですか?

プロンプト キャッシュ (Anthropic Cache_control、OpenAI 自動キャッシュ) は、同一のトークン プレフィックスに対して KV 計算を再利用します。セマンティック キャッシュはアプリケーション レベルで行われます。クエリがセマンティックに類似している場合、キャッシュされた完全な応答が提供されます。それらは補完的なものです。

LLM のセマンティック キャッシュを提供するツールは何ですか?

一般的なオプション: GPTCache (オープン ソース)、Momento Vector Index (マネージド)、Zep (メモリ層)、LangChain CacheBackedEmbeddings、ベクトル検索を備えた Redis。マネージド オプションの料金は月額 10 ~ 200 ドルです。セルフホスト型 Redis の料金は、小規模な VM で月額 5 ~ 30 ドルです。