Publié 2026-08-05 · numéros de référence, vérifier avant de budgétiser
Câbler un serveur MCP à un agent est une expérience totalement gratuite. Pas d'inscription, pas de facture par outil, pas d'animation de compteur. Ensuite, vous regardez ce qui est réellement envoyé sur le fil. Connectez 25 outils à une fréquence typique ~ 1 000 jetons de schéma chacun — le chiffre qui est sorti du modèlecontextprotocol GitHub problème #2808 sur les définitions d'outils du monde réel - et cela représente 25 000 jetons qui accompagnent à chaque tour de chaque session, que le modèle appelle un outil à ce tour ou non. À 20 tours par session et 50 sessions par jour, sans mise en cache, c'est-à-dire 2 250 $ par mois. Personne n'a mis ce numéro dans le démarrage rapide du MCP.
Les API LLM sont sans état. Chaque appel est une nouvelle requête HTTP sans mémoire côté serveur de la dernière, de sorte que le client (Claude Code, Claude Desktop, quel que soit le framework d'agent qui pilote la boucle) doit re-sérialiser le bloc de schéma d'outil complet dans la requête à chaque fois. Le tour 1 en paie le prix. Le tour 20 le paie à nouveau. Une session de 20 tours ne charge pas les outils une seule fois ; il les transmet vingt fois et est facturé à chaque fois comme des jetons d'entrée ordinaires, c'est exactement pourquoi le coût se cache bien en vue sur la facture au lieu d'apparaître sous la forme d'un élément appelé « taxe MCP ».
Personne ne s'assoit et ne décide de dépenser 2 250 $ par mois en schémas d'outils. Ce qui se passe, c'est qu'une équipe connecte un serveur de système de fichiers, un serveur de base de données, un serveur de recherche et quelques serveurs internes "puisqu'ils sont là", et le nombre d'outils passe de 5 à 75 sans que personne ne le retarifie. Mêmes 20 tours, mêmes 50 séances par jour, même prix de 3 $/0,30 $ par million — seul le nombre d'outils bouge.
| Outils connectés | Jetons de schéma | % de contexte de 200 000 | Pas de mise en cache / mois | En cache / mois |
|---|---|---|---|---|
| 5 (un serveur) | 5,000 | 2.5% | $450 | $65 |
| 15 | 15,000 | 7.5% | $1,350 | $196 |
| 25 | 25,000 | 12.5% | $2,250 | $326 |
| 50 | 50,000 | 25% | $4,500 | $653 |
| 75 (cinq serveurs) | 75,000 | 37.5% | $6,750 | $979 |
| 20 tours/session, 50 sessions/jour, 3,00 $ d'entrée / 0,30 $ de lecture de cache par 1 million de jetons. Modèle de référence : exécutez vos propres chiffres sur le Calculateur de frais généraux de jeton de schéma de l'outil MCP. | ||||
La ligne qui devrait vous arrêter est la troisième colonne. Avec 75 outils, plus d'un tiers d'une fenêtre contextuelle de 200 000 est disparu avant que l'utilisateur n'ait tapé quoi que ce soit - ni pour une conversation, ni pour des documents récupérés, ni pour un raisonnement, pour des définitions d'outils que le modèle peut appeler zéro fois cette session. Il s'agit d'un contexte que l'agent ne peut pas utiliser pour autre chose, mis en cache ou non.
La mise en cache rapide est une véritable réduction ici : payez le prix fort une fois pour écrire le bloc de schéma d'outil, puis relisez-le à environ 90 % de réduction – environ 0,30 $ au lieu de 3 $ par million de jetons sur un modèle de classe Sonnet – pour chaque tour suivant, tant que le bloc se trouve à une position fixe et précoce et ne change jamais. C'est pourquoi la colonne mise en cache ci-dessus est 85 % inférieure à celle non mise en cache sur chaque ligne.
Le problème est que le cache ne rapporte que sur un préfixe identique en octets. Ajoutez un outil, supprimez-en un, réorganisez la liste ou laissez un orchestrateur échanger des ensembles d'outils en cours de session et vous obtenez un échec de cache - à nouveau le prix fort à partir de ce moment-là. La fenêtre de cache elle-même est courte : cinq minutes pour le niveau rapide, jusqu'à une heure pour le niveau plus long, selon le fournisseur. Une session qui reste inactive entre les appels, ou une nouvelle session qui démarre après l'expiration de la fenêtre, ne bénéficie d'aucune réduction. La mise en cache récompense une liste d’outils statiques et punit tout ce qui remanie le schéma en cours de conversation – ce qui est précisément ce que font de nombreuses couches d’orchestration par conception.
Dès qu'un serveur est connecté, ses schémas sont intégrés à chaque requête de chaque session à laquelle il est attaché, appelée ou non. Un outil inactif n’est pas une option gratuite placée en arrière-plan ; il s'agit d'environ 1 000 jetons de coût d'entrée par tour, identique à un outil invoqué en permanence, et le modèle ne dépense pas 1 000 jetons pour la conversation réelle. Cinq serveurs dotés de quinze outils chacun représentent 75 000 jetons de schéma avant qu'un seul message utilisateur n'arrive, même si soixante de ces soixante-quinze outils ne sont jamais appelés. Connecter chaque serveur MCP disponible « juste au cas où » n'est pas une valeur par défaut neutre : il s'agit d'une redevance mensuelle permanente plus une taxe contextuelle, payée qu'une partie soit utilisée ou non.
Cela vaut la peine de les séparer clairement, car les deux chiffres se confondent constamment : ce qu'il en coûte pour construire, héberger et entretenir un serveur MCP - couvert sur le Calculateur de coût du serveur MCP - les dépenses d'infrastructure sont-elles payées par celui qui les exploite, et elles ne varient pas en fonction de l'utilisation qu'une conversation donnée en fait. La taxe décrite dans cet article est une facture complètement différente, payée par celui qui paie la facture de l'API LLM, qui évolue avec les sessions et les tours plutôt qu'avec les efforts d'ingénierie. Un serveur dont l'hébergement sur un processus stdio local ne coûte aucun dollar peut quand même brûler des centaines de dollars par mois en jetons de schéma de l'autre côté du grand livre. Les deux sont réels. Ni l’un ni l’autre ne remplace l’autre dans un budget honnête.
Les outils MCP ne sont pas chers à appeler. Leur connexion coûte cher, à chaque tour, qu'ils soient appelés ou non - et ce coût est presque invisible car il arrive sous forme de jetons d'entrée ordinaires sur une facture qui en contient déjà beaucoup. La mise en cache réduit le montant en dollars d'environ 85 % et ne fait rien pour la part de fenêtre contextuelle, qui est le nombre qui dégrade en réalité une longue session. Le correctif ne coûte rien : connectez moins de serveurs, maintenez la liste stable et vérifiez les calculatrice avant que le nombre d’outils ne dépasse le prix fixé par quiconque.
Méthodologie : la taille moyenne du schéma d'environ 1 000 jetons est le chiffre rapporté par la communauté à partir du numéro 2808 de modelcontextprotocol GitHub, et non une mesure d'un déploiement spécifique — la taille réelle du schéma varie en fonction du degré de détail des descriptions des paramètres de chaque outil. Le prix (3,00 $ d'entrée / 0,30 $ de lecture de cache par million de jetons) reflète les tarifs publiés d'un modèle de classe Sonnet en août 2026. Le tableau travaillé est un scénario construit destiné à montrer comment les nombres évoluent avec le nombre d'outils, et non avec la télémétrie d'un système de production. Confirmez les prix actuels et votre propre nombre de tours/sessions avant de budgétiser.