Publicado 2026-08-05 · números de referencia, verificar antes de presupuestar
Conectar un servidor MCP a un agente es una sensación gratuita. Sin registro, sin factura por herramienta, sin animación del medidor. Luego miras lo que realmente se envÃa por cable. Conecte 25 herramientas a la vez ~1000 tokens de esquema cada uno — la figura que salió del modelcontextprotocol GitHub número 2808 en definiciones de herramientas del mundo real, y eso son 25.000 tokens viajando en cada vuelta de cada sesión, ya sea que el modelo llame a una herramienta en ese turno o no. A 20 turnos por sesión y 50 sesiones por dÃa, sin caché, es decir $2,250 al mes. Nadie puso ese número en el inicio rápido de MCP.
Las API de LLM no tienen estado. Cada llamada es una solicitud HTTP nueva sin memoria del lado del servidor de la última, por lo que el cliente (Claude Code, Claude Desktop, cualquier marco de agente que esté impulsando el ciclo) tiene que volver a serializar el bloque completo del esquema de la herramienta en la solicitud cada vez. El turno 1 lo paga. Cumplir 20 vuelve a pagarlo. Una sesión de 20 turnos no carga las herramientas una vez; los transmite veinte veces y se factura como tokens de entrada ordinarios cada vez, que es exactamente la razón por la que el costo se oculta a la vista en la factura en lugar de aparecer como una partida llamada "impuesto MCP".
Nadie se sienta y decide gastar 2250 dólares al mes en esquemas de herramientas. Lo que sucede es que un equipo conecta un servidor de sistema de archivos, un servidor de base de datos, un servidor de búsqueda y un par de servidores internos "ya que están allÃ", y el recuento de herramientas aumenta de 5 a 75 sin que nadie le vuelva a fijar el precio. Los mismos 20 turnos, las mismas 50 sesiones por dÃa, el mismo precio de $ 3/$ 0,30 por millón en todo momento: solo cambia el recuento de herramientas.
| Herramientas conectadas | Fichas de esquema | % de contexto de 200 000 | Sin almacenamiento en caché / mes | En caché / mes |
|---|---|---|---|---|
| 5 (un servidor) | 5,000 | 2.5% | $450 | $65 |
| 15 | 15,000 | 7.5% | $1,350 | $196 |
| 25 | 25,000 | 12.5% | $2,250 | $326 |
| 50 | 50,000 | 25% | $4,500 | $653 |
| 75 (cinco servidores) | 75,000 | 37.5% | $6,750 | $979 |
| 20 turnos/sesión, 50 sesiones/dÃa, entrada de $3,00/lectura de caché de $0,30 por 1 millón de tokens. Modelo de referencia: ejecute sus propios números en el Calculadora de gastos generales de token de esquema de herramienta MCP. | ||||
La lÃnea que deberÃa detenerte es la tercera columna. Con 75 herramientas, más de un tercio de una ventana de contexto de 200 000 desaparece antes de que el usuario haya escrito algo: ni la conversación, ni los documentos recuperados, ni el razonamiento, ni las definiciones de herramientas que el modelo puede llamar cero veces en esa sesión. Ese es el contexto que el agente no puede usar para nada más, ya sea en caché o no.
El almacenamiento en caché rápido es un verdadero descuento aquÃ: pague el precio completo una vez para escribir el bloque de esquema de herramienta, luego vuelva a leerlo con aproximadamente un 90% de descuento (alrededor de $0,30 en lugar de $3 por millón de tokens en un modelo de clase Sonnet) para cada turno posterior, siempre y cuando el bloque se encuentre en una posición inicial fija y nunca cambie. Es por eso que la columna almacenada en caché de arriba se ejecuta un 85% por debajo de la que no está almacenada en caché en cada fila.
El problema es que el caché sólo se amortiza con un prefijo de bytes idénticos. Agregue una herramienta, elimine una, reordene la lista o deje que un orquestador intercambie conjuntos de herramientas a mitad de sesión y obtendrá una pérdida de caché: el precio completo nuevamente a partir de ese momento. La ventana de caché en sà es corta: cinco minutos en el nivel rápido, hasta una hora en el más largo, según el proveedor. Una sesión que permanece inactiva entre llamadas, o una sesión nueva que comienza después de que transcurre el perÃodo, no obtiene ningún descuento. El almacenamiento en caché recompensa una lista de herramientas estáticas y castiga cualquier cosa que reorganice el esquema en mitad de una conversación, que es precisamente lo que hacen muchas capas de orquestación por diseño.
En el momento en que se conecta un servidor, sus esquemas entran en cada solicitud de cada sesión que lo tiene adjunto, llamado o no. Una herramienta inactiva no es una opción gratuita que se encuentra en segundo plano; Son aproximadamente 1000 tokens de costo de entrada por turno, idéntico a una herramienta que se invoca constantemente, y son 1000 tokens que el modelo no gasta en la conversación real. Cinco servidores con quince herramientas cada uno son 75.000 tokens de esquema antes de que llegue un solo mensaje de usuario, incluso si nunca se llama a sesenta de esas setenta y cinco herramientas. Conectar todos los servidores MCP disponibles "por si acaso" no es una opción predeterminada neutral: es un cargo mensual permanente más un impuesto de contexto, que se paga independientemente de que se utilice o no.
Vale la pena separarlos claramente, porque los dos números se confunden constantemente: cuánto cuesta construir, alojar y mantener un servidor MCP, cubierto en el Calculadora de costos del servidor MCP – es el gasto en infraestructura pagado por quien lo opera, y no varÃa con cuánto lo utiliza una conversación determinada. El impuesto en este artÃculo es una factura completamente diferente, pagada por quien paga la factura de LLM API, que aumenta con las sesiones y los turnos en lugar del esfuerzo de ingenierÃa. Un servidor cuyo alojamiento en un proceso stdio local cuesta cero dólares aún puede estar quemando cientos de dólares al mes en tokens de esquema en el otro lado del libro mayor. Ambos son reales. Ninguno sustituye al otro en un presupuesto honesto.
Las herramientas MCP no son caras de utilizar. Es costoso tenerlos conectados, en cada turno, ya sea que se llamen o no, y ese costo es casi invisible porque llega como tokens de entrada ordinarios en un billete que ya tiene muchos de ellos. El almacenamiento en caché reduce la cifra en dólares en aproximadamente un 85% y no hace nada por la participación de la ventana de contexto, que es la cifra que realmente degrada una sesión larga. La solución no cuesta nada: conecte menos servidores, mantenga la lista estable y verifique el calculadora antes de que el recuento de herramientas supere el precio de cualquiera.
MetodologÃa: el tamaño promedio del esquema de ~1,000 tokens es la cifra reportada por la comunidad en el número 2808 de GitHub del protocolo modelcontext, no una medida de ninguna implementación especÃfica; el tamaño real del esquema varÃa según cuán detalladas sean las descripciones de los parámetros de cada herramienta. El precio ($3,00 de entrada / $0,30 de lectura de caché por 1 millón de tokens) refleja las tarifas publicadas de un modelo de clase Sonnet a partir de agosto de 2026. La tabla trabajada es un escenario construido destinado a mostrar cómo los números escalan con el recuento de herramientas, no con la telemetrÃa de un sistema de producción. Confirme los precios actuales y su propio recuento de turnos/sesiones antes de realizar el presupuesto.