2026 年 7 月 8 日公開 · 参照番号、予算編成前に確認してください
LLM API を使用してチャットボットを構築すると、送信するすべてのメッセージに 完全な会話履歴 入力として。最新のユーザーの質問だけでなく、過去のすべてのターン、すべてのアシスタントの回答、すべて。これが、LLM がコンテキストを維持する方法です。それはまた、あなたのコストが驚くべきものへと静かに複合化する方法でもあります。
1 つの会話のメッセージ 30 までに、入力トークン数は約 1,150 トークンから 11,000 以上に増加しました。で $5/1M 入力トークン (GPT-4o の価格設定)、1 回の応答では、最初の応答のほぼ 7 倍のコストがかかります。
チャットボットに 1,000 トークンのシステム プロンプトがあり、ユーザーが平均 150 トークンのメッセージを送信し、モデルが毎回約 200 トークンで応答するとします。ターン中 k:
input(k) = 1,000 (システム) + (k−1) × (150 + 200) (前のターン) + 150 (現在のメッセージ)
それを単純化すると、 800 + 350k。コストはターンごとに直線的に増加します。これは、ターンごとに将来のすべての呼び出しに 350 トークンが永久に追加されるためです。
| 振り向く | 入力トークン | 投入コスト (100 万ドルあたり 5 ドル) | 総ターンコスト |
|---|---|---|---|
| 1 | 1,150 | $0.0058 | $0.009 |
| 5 | 2,550 | $0.0128 | $0.016 |
| 10 | 4,300 | $0.0215 | $0.025 |
| 20 | 7,800 | $0.039 | $0.042 |
| 30 | 11,300 | $0.0565 | $0.060 |
価格は参考見積り、2026 年 7 月。 古い価格を報告する →
出力: 200 トークン × $15/1M = ターンあたり $0.003。モデル: GPT-4o (参考価格 5 ドル/15 ドル)。
ターン 30 のコストは $0.060、ターン 1 のコストは $0.009 — 6.8倍の差 同じ 150 トークンのユーザー質問と 200 トークンの応答の場合。
30 ターンをすべて合計すると、会話全体での入力の合計は次のようになります。 186,750トークン. Total cost:
API がステートレスで、各呼び出しが現在のターン (1,150 トークン) のみを送信した場合、同じ 30 ターンのコストは 30 × 0.009 ドル = $0.27。会話履歴が追加されます 0.75 ドルの追加投入コスト — モデルがすでに処理したものを再読み込みするのに費やされる費用。
1 日あたり 10,000 人のユーザー、各平均 15 ターン:
| 1日あたりの費用 | 月額費用 | |
|---|---|---|
| 15ターン会話(履歴あり) | $1,840 | $55,200 |
| ステートレス (仮説、履歴なし) | $810 | $24,300 |
| 履歴のオーバーヘッド | $1,030 | $30,900 |
履歴のオーバーヘッドは請求上のバグではありません。これは、呼び出しごとにすべてのトークンの価格を決定する、API 上で会話型 AI を構築するための構造的なコストです。ほとんどのチームは、月末の請求書が届いたときにそれを発見します。
1. 古いメッセージを削除します。 最後の N ターン (例: 5 ~ 8) のみを保持します。古い文脈がほとんど問題にならない、事実に基づく Q&A アシスタントに適しています。午後に実装された最も安価な修正。トレードオフ: モデルは初期のコンテキストを忘れます。
2. 要約を使用して圧縮します。 5 ~ 10 ターンごとに、モデルを 1 回呼び出して、これまでの会話を要約します。生の履歴を概要に置き換えます。コスト: N ターンごとに 1 回の追加コール。利点: 会話の長さに関係なく、履歴のオーバーヘッドはほぼ一定のままです。
3. セマンティック フィルタリングを備えたスライディング ウィンドウ。 最近のターンを常に保持し、埋め込みを使用して意味的に関連する古いターンのみを選択的に含めます。より複雑ですが、履歴を完全にコストをかけずに重要なコンテキストを保持します。サポートや研究アシスタントのために大規模に実装する価値があります。
4. 即時のキャッシュ。 Claude と Gemini では、静的システム プロンプトをキャッシュ可能としてマークすると、その部分が 50 ~ 90% オフになります。成長する履歴 (これは常に固有です) には役立ちませんが、固定オーバーヘッドは軽減されます。 1,000 トークンのシステム プロンプトからの呼び出しごとに 0.0050 ドルかかりますが、これをキャッシュすると、1 ターンあたり ~0.0045 ドル節約できます。これは、何百万回もの呼び出しにわたって意味があります。を参照してください。 プロンプトキャッシュ節約計算ツール.
ほとんどの実稼働チャットボットでは、6 ~ 10 ターンのローリング ウィンドウに加えて、あるしきい値での圧縮パスを使用する必要があります。 「すべての履歴を永久に送信する」は、プロトタイプの適切なデフォルトです。これは実稼働環境にとって高価なデフォルトです。
に自分の数字を入れてください 会話履歴コスト計算ツール ターン全体でコストがどこにかかるかを正確に確認し、モデルを比較し、圧縮削減量を見積もることができます。 30 ターン履歴と 5 ターン ウィンドウの違いは、多くの場合、同じ製品エクスペリエンスに対してコストが 60 ~ 70% 低いことです。
API 呼び出しごとに、完全な会話履歴が入力トークンとして再送信されます。ターンごとにユーザー メッセージとアシスタントの応答がその後のすべてに追加されるため、入力サイズはターン数に応じて直線的に増加します。
最も現実的な修正は、ローリング ウィンドウです。すべての履歴ではなく、最後の 5 ~ 10 ターンのみを保持します。コンテキストが重要なアシスタントの場合、定期的な要約により、古いターンを短い段落に圧縮して、コストを一定に保つことができます。を使用します。 会話履歴コスト計算ツール 節約をモデル化します。
静的部分 (システム プロンプト、ツール定義) のみ。成長履歴は会話ごとに一意であるため、キャッシュすることはできません。キャッシュは、固定オーバーヘッド、つまり変動する履歴部分に関係なく支払う費用を削減するのに役立ちます。
GPT-4o の場合、100 万トークンあたり 5 ドル/15 ドル、システム プロンプト 1,000 トークン、ユーザー ターン 150 トークン、アシスタント応答 200 トークンで合計約 1.02 ドルになります。最初のターンのコストは $0.009、最後のターンのコストは $0.060 となり、ほぼ 7 倍になります。
2026 年 6 月の GPT-4o 価格に基づく参照番号 — プロバイダーの価格ページで現在の料金を確認してください。