2026 年 8 月 5 日公開 · 参照番号、予算編成前に確認してください
MCP サーバーをエージェントに接続するのは自由です。サインアップ、ツールごとの請求、メーターアニメーションはありません。次に、実際に何が送信されるかを調べます。通常、25 個のツールを接続 それぞれ最大 1,000 個のスキーマ トークン —そこから出てきた図 モデルコンテキストプロトコル GitHub 問題 #2808 現実世界のツール定義に基づいて、25,000 個のトークンが使用されます。 毎ターン モデルがそのターンでツールを呼び出すかどうかに関係なく、すべてのセッションの。 1 セッションが 20 ターンで、1 日あたり 50 セッションがキャッシュされない場合、つまり 月額 2,250 ドル。誰も MCP クイックスタートにその数字を入れていません。
LLM API はステートレスです。すべての呼び出しは、最後の呼び出しのサーバー側メモリを持たない新しい HTTP リクエストであるため、クライアント (クロード コード、クロード デスクトップ、ループを駆動しているエージェント フレームワークなど) は、毎回完全なツール スキーマ ブロックをリクエストに再シリアル化する必要があります。ターン1でその代償は払えます。ターン 20 で再びその代償が支払われます。 20 ターンのセッションでは、ツールは一度もロードされません。それらを 20 回送信し、そのたびに通常の入力トークンとして請求されます。まさにこれが、コストが「MCP 税」と呼ばれる項目として表示されるのではなく、請求書の目に見えないところに隠れている理由です。
誰も座ってツール スキーマに月額 2,250 ドルを費やすことを決定しません。何が起こるかというと、チームはファイル システム サーバー、データベース サーバー、検索サーバー、およびいくつかの内部サーバーを「そこにあるから」接続し、誰も価格を変更することなくツールの数が 5 から 75 へと徐々に増えていきます。同じ 20 ターン、同じ 1 日あたり 50 セッション、100 万あたりの価格は同じ 3 ドル/0.30 ドルで、ツール数のみが変わります。
| 接続されたツール | スキーマトークン | 200K コンテキストの % | キャッシュなし/月 | キャッシュ済み / 月 |
|---|---|---|---|---|
| 5 (1 サーバー) | 5,000 | 2.5% | $450 | $65 |
| 15 | 15,000 | 7.5% | $1,350 | $196 |
| 25 | 25,000 | 12.5% | $2,250 | $326 |
| 50 | 50,000 | 25% | $4,500 | $653 |
| 75 (サーバー 5 台) | 75,000 | 37.5% | $6,750 | $979 |
| 20 ターン/セッション、50 セッション/日、100 万トークンあたり入力 $3.00 / キャッシュ読み取り $0.30。参照モデル — 独自の数値を実行します。 MCP ツール スキーマ トークン オーバーヘッド計算ツール. | ||||
停止する必要がある行は 3 列目です。ツールが 75 個あると、ユーザーが何かを入力する前に、200K コンテキスト ウィンドウの 3 分の 1 以上が消えてしまいます。会話ではなく、取得したドキュメントでもなく、推論でもなく、モデルがそのセッションで 0 回呼び出す可能性のあるツール定義でもなく。これは、キャッシュされているかどうかにかかわらず、エージェントが他の目的で使用できないコンテキストです。
ここでのプロンプト キャッシュは実質的な割引です。ツール スキーマ ブロックの書き込みに一度全額を支払い、ブロックが初期の固定位置にあり変更されない限り、その後は毎ターン、およそ 90% オフ (Sonnet クラス モデルでは 100 万トークンあたり 3 ドルではなく、約 0.30 ドル) で読み戻されます。そのため、上記のキャッシュされた列は、すべての行においてキャッシュされていない列よりも 85% 低く実行されます。
問題は、キャッシュがバイト同一のプレフィックスに対してのみ効果を発揮することです。セッション中にツールを追加したり削除したり、リストの順序を変更したり、オーケストレーターにツールセットを交換させたりすると、キャッシュ ミスが発生し、その時点からは再び全額料金が発生します。キャッシュ ウィンドウ自体は短く、プロバイダーによって異なりますが、高速層では 5 分、長い層では最大 1 時間です。コール間でアイドル状態になるセッション、またはウィンドウが経過した後に開始される新しいセッションには、まったく割引がありません。キャッシュは静的なツール リストに報酬を与え、会話中にスキーマを再シャッフルするものを罰します。これはまさに多くのオーケストレーション レイヤーが設計上行っていることです。
サーバーが接続された瞬間、そのスキーマは、呼び出されているかどうかに関係なく、接続されているすべてのセッションのすべてのリクエストに組み込まれます。アイドル ツールは、バックグラウンドで待機している無料のオプションではありません。これは 1 ターンあたりの入力コストとしておよそ 1,000 トークンであり、継続的に呼び出されるツールと同じであり、モデルが実際の会話に費やすのは 1,000 トークンです。 15 個のツールを備えた 5 台のサーバーでは、75 個のツールのうち 60 個が呼び出されなかったとしても、1 つのユーザー メッセージが到着するまでに 75,000 個のスキーマ トークンが存在します。 「万が一に備えて」利用可能なすべての MCP サーバーに接続することは、中立的なデフォルトではありません。これは、月額料金に加えて、使用の有無に関係なく支払われるコンテキスト税です。
MCP サーバーの構築、ホスト、保守にかかる費用という 2 つの数値は常に混同されるため、明確に分離する価値があります。 MCP サーバーのコスト計算ツール — インフラストラクチャの支出は、それを運用する人によって支払われ、特定の会話でのインフラストラクチャの使用量によって変動するものではありません。この記事の税金は、LLM API の請求書を作成する人によって支払われる、まったく異なる請求書であり、エンジニアリングの労力ではなく、セッションやターン数に応じて拡張されます。ローカルの標準入出力プロセスでホストするのにコストがゼロのサーバーでも、台帳の反対側ではスキーマ トークンとして月に数百ドルを消費する可能性があります。どちらも本物です。正直な予算内では、どちらも他方の代わりにはなりません。
MCP ツールの呼び出しには費用がかかりません。コールされるかどうかに関係なく、毎回接続するにはコストがかかります。そして、そのコストは、すでに大量のトークンが含まれている請求書の通常の入力トークンとして届くため、ほとんど目に見えません。キャッシュはドルの数値を約 85% 削減しますが、コンテキスト ウィンドウのシェアには何も影響しません。コンテキスト ウィンドウのシェアは、実際に長いセッションのパフォーマンスを低下させる数値です。修正には費用はかかりません。接続するサーバーの数を減らし、リストを安定させて、 電卓 ツールの数が誰かの価格を超えてしまう前に。
方法論: ~1,000 トークンの平均スキーマ サイズは、modelcontextprotocol GitHub 問題 #2808 からコミュニティで報告された数値であり、特定のデプロイメントの測定値ではありません。実際のスキーマ サイズは、各ツールのパラメーターの説明がどれほど冗長であるかによって異なります。価格設定 (100 万トークンあたり入力 $3.00 / キャッシュ読み取り $0.30) は、2026 年 8 月時点の Sonnet クラス モデルの公開料金を反映しています。作業済みの表は、運用システムからのテレメトリではなく、ツール数に応じて数値がどのように拡大するかを示すことを目的とした構築されたシナリオです。予算を立てる前に、現在の価格と独自のターン/セッション数を確認してください。