2026 年 7 月 15 日発行 · 参考価格、予算を立てる前に確認してください
「AI サポート チャットボットの費用はいくらですか?」は最もよくある質問の 1 つです。その答えはモデルによって 23 倍異なり、会話履歴が蓄積されるにつれて予想よりも速く増加します。
| モデル | 100 万ドルあたり | 100 万ドルあたりのアウト | チャットあたりのコスト | 100,000 チャット/月 | 年間 |
|---|---|---|---|---|---|
| ジェミニ 2.0 フラッシュ | $0.10 | $0.40 | $0.0043 | $432 | $5,184 |
| GPT-4oミニ | $0.15 | $0.60 | $0.0065 | $648 | $7,776 |
| クロード俳句 4.5 | $0.80 | $4.00 | $0.0374 | $3,744 | $44,928 |
| GPT-4o | $2.50 | $10.00 | $0.1013 | $10,125 | $121,500 |
| クロード・ソネット 4 | $3.00 | $15.00 | $0.1258 | $12,576 | $150,912 |
チャットボットのコスト見積もりのほとんどが間違っているのはここです。これらは固定トークン数でメッセージあたりのコストをモデル化しますが、実際には各メッセージに完全な履歴が含まれます。
| メッセージ # | 入力トークン (履歴を含む) | 出力トークン | フラッシュコスト | GPT-4oのコスト |
|---|---|---|---|---|
| 1 | 550 | 280 | $0.000167 | $0.00418 |
| 2 | 900 | 280 | $0.000202 | $0.00505 |
| 4 | 1,400 | 280 | $0.000252 | $0.00630 |
| 6 | 1,950 | 280 | $0.000307 | $0.00768 |
| 8(決勝) | 2,500 | 280 | $0.000362 | $0.00905 |
| 合計 (8 メッセージ) | ~10,800 | ~2,240 | $0.0043 | $0.101 |
すべてのサポート クエリに同じモデルが必要なわけではありません。クエリを別の層にルーティングします。
シンプルなインテント分類子 (それ自体は安価です。Flash はルーティング コールごとに ~$0.002 です) を使用して、どの層が各会話を処理するかを制御できます。
すべてのメッセージに完全なトランスクリプトを含める代わりに、メッセージ 4 の後に会話を要約し、メッセージ 5 以降については圧縮された要約 (約 200 トークン) を渡します。これにより、コンテキストが直線的に成長するのではなく、安定した状態が保たれます。
効果: メッセージごとの平均入力が 1,350 トークンから ~600 トークンに減少し、入力コストが 55% 削減されます。 GPT-4o の場合: $10,125 → ~$5,400/月。
システム プロンプトと FAQ コンテキスト (このモデルでは 400 トークン) がすべてのメッセージで繰り返されます。 Anthropic と OpenAI は両方ともプロンプト キャッシングを提供します。繰り返されるプレフィックス トークンは、最初のリクエスト後に通常料金の 10 ~ 50% で請求されます。
システム プロンプトが 1,000 トークンであり、それをキャッシュすると、後続のすべてのメッセージでその 1,000 トークンが 90% 節約されます。 10 万チャット × 8 メッセージ = 80 万メッセージ、つまり 8 億トークン × 0.10 ドル/100 万 × 90% = Flash だけで月額 72 ドル節約。 GPT-4o では、絶対的な節約効果がさらに大きくなります。
| 規模 | フラッシュ | ブレンド (ルーティング) | GPT-4o |
|---|---|---|---|
| 10,000 チャット/月 (起動時) | $43 | $164 | $1,013 |
| 100,000 チャット/月 (増加) | $432 | $1,639 | $10,125 |
| 500k チャット/月 (規模) | $2,160 | $8,195 | $50,625 |
| 100 万チャット/月 (エンタープライズ) | $4,320 | $16,390 | $101,250 |
100 万チャット/月の場合、Flash と GPT-4o の差は 97,000 ドル/月、つまり年間 116 万ドルになります。 Flash が人間のエージェントへのエスカレーションを 15% 増やす必要があるとしても、計算上はほとんどの場合、安価なモデル層が有利になります。
それが本当の質問であり、それは完全にユースケースによって異なります。のために よくある質問への回答、注文状況、返品ポリシー、配送情報 — Flash は、制御された評価において GPT-4o と同等のパフォーマンスを発揮します。のために 微妙な苦情処理、複数ステップのトラブルシューティング、またはエッジケースについての真の推論が必要な状況 — フロンティアモデルには目に見える利点があります。
実際のアプローチ: Flash を 30 日間実行し、エスカレーション率と CSAT を測定し、ベースラインと比較します。 CSAT が 1 ポイント未満に低下し、エスカレーションが 5% 未満に上昇した場合、コスト削減によりモデルの切り替えが正当化されます。
平均 8 メッセージで月あたり 100,000 チャットの場合: Gemini Flash ~$432、GPT-4o mini ~$648、Claude Haiku ~$3,744、GPT-4o ~$10,125。モデルの選択は最大のコストレバーです。
すべてのメッセージには、入力トークンとして完全な履歴が含まれます。メッセージ 1 には最大 400 の入力トークンがかかります。メッセージ 8 のコストは約 2,500 で、同じ出力の場合は 6 倍になります。会話の要約を行わないと、チャットの長さに応じてコストが直線的に増加します。
FAQ への回答、注文ステータス、ポリシーに関する質問については、通常は「はい」です。微妙な苦情処理や複雑なトラブルシューティングの場合は、まずベンチマークを行ってください。多くのチームはボリュームの 60 ~ 70% で Flash を実行し、エッジ ケースのフロンティア モデルにエスカレーションします。
3 つの主な手段: (1) モデル ルーティング — 単純なクエリには Flash を使用し、複雑なクエリには GPT-4o のみを使用します。 (2) 会話の要約 — 古い履歴を約 200 個のトークンに圧縮します。 (3) プロンプト キャッシュ — Anthropic と OpenAI はどちらも、繰り返されるプロンプト プレフィックスに対して 50 ~ 90% の割引を提供します。