HomeBlog › Imposto sobre token de esquema de ferramenta MCP

Os esquemas de ferramentas MCP custam US$ 2.250 por mês antes de você chamar uma única ferramenta

Publicado em 05/08/2026 · números de referência, verifique antes de orçamentar

Conectar um servidor MCP a um agente é fácil. Sem inscrição, sem fatura por ferramenta, sem animação de medidor. Então você olha o que realmente é enviado pela transmissão. Conecte 25 ferramentas em um típico Cerca de 1.000 tokens de esquema cada - a figura que saiu do modelcontextprotocol problema do GitHub nº 2808 em definições de ferramentas do mundo real - e isso representa 25.000 tokens circulando cada volta de cada sessão, quer o modelo chame uma ferramenta naquele turno ou não. Aos 20 turnos por sessão e 50 sessões por dia, sem cache, ou seja $ 2.250 por mês. Ninguém colocou esse número no início rápido do MCP.

Por que isso se repete em vez de ser um custo único

APIs LLM não têm estado. Cada chamada é uma nova solicitação HTTP sem memória da última no lado do servidor, portanto, o cliente — Claude Code, Claude Desktop, qualquer estrutura de agente que esteja conduzindo o loop — precisa serializar novamente o bloco completo do esquema da ferramenta na solicitação a cada vez. O turno 1 paga por isso. Fazer 20 anos paga por isso novamente. Uma sessão de 20 turnos não carrega as ferramentas uma única vez; ele os transmite vinte vezes e é cobrado como tokens de entrada comuns a cada vez, e é exatamente por isso que o custo fica oculto na fatura, em vez de aparecer como um item de linha chamado “imposto MCP”.

O que conectar mais servidores realmente contribui para a conta

Ninguém se senta e decide gastar US$ 2.250 por mês em esquemas de ferramentas. O que acontece é que uma equipe conecta um servidor de sistema de arquivos, um servidor de banco de dados, um servidor de pesquisa e alguns internos "já que eles estão lá", e a contagem de ferramentas aumenta de 5 para 75 sem que ninguém reavalie seu preço. Os mesmos 20 turnos, as mesmas 50 sessões por dia, os mesmos preços de US$ 3/US$ 0,30 por milhão – apenas a contagem de ferramentas se move.

Ferramentas conectadasTokens de esquema% de 200 mil contextosSem cache / mêsEm cache / mês
5 (um servidor)5,0002.5%$450$65
1515,0007.5%$1,350$196
2525,00012.5%$2,250$326
5050,00025%$4,500$653
75 (cinco servidores)75,00037.5%$6,750$979
20 turnos/sessão, 50 sessões/dia, entrada de US$ 3,00/leitura de cache de US$ 0,30 por 1 milhão de tokens. Modelo de referência – execute seus próprios números no Calculadora de sobrecarga de token de esquema de ferramenta MCP.

A linha que deve parar você é a terceira coluna. Em 75 ferramentas, mais de um terço de uma janela de contexto de 200K desaparece antes que o usuário digite qualquer coisa – nem para conversação, nem para documentos recuperados, nem para raciocínio, nem para definições de ferramentas que o modelo pode chamar zero vezes naquela sessão. Esse é o contexto que o agente não pode usar para mais nada, armazenado em cache ou não.

O cache recupera a maior parte do custo em dólares – com uma pegadinha

O cache imediato é um desconto real aqui: pague o preço total uma vez para escrever o bloco de esquema de ferramenta e, em seguida, leia-o novamente com cerca de 90% de desconto – cerca de US$ 0,30 em vez de US$ 3 por milhão de tokens em um modelo da classe Sonnet – para cada turno depois disso, desde que o bloco fique em uma posição inicial fixa e nunca mude. É por isso que a coluna armazenada em cache acima é executada 85% abaixo da coluna não armazenada em cache em cada linha.

O problema é que o cache só compensa em um prefixo idêntico ao byte. Adicione uma ferramenta, remova uma, reordene a lista ou deixe um orquestrador trocar conjuntos de ferramentas no meio da sessão e você terá uma perda de cache – preço total novamente a partir desse ponto. A janela de cache em si é curta: cinco minutos no nível rápido, até uma hora no nível mais longo, dependendo do provedor. Uma sessão que fica ociosa entre as chamadas ou uma nova sessão que começa após o término da janela não recebe nenhum desconto. O cache recompensa uma lista de ferramentas estáticas e pune qualquer coisa que reorganize o esquema no meio da conversa – que é exatamente o que muitas camadas de orquestração fazem por design.

A parte que as equipes não percebem: as ferramentas não utilizadas custam o mesmo que as usadas

No momento em que um servidor é conectado, seus esquemas entram em cada solicitação de cada sessão que o possui anexado – chamada ou não. Uma ferramenta ociosa não é uma opção gratuita em segundo plano; são cerca de 1.000 tokens de custo de entrada por turno, idêntico a uma ferramenta que é invocada constantemente, e são 1.000 tokens que o modelo não está gastando na conversa real. Cinco servidores com quinze ferramentas cada um equivalem a 75.000 tokens de esquema antes que uma única mensagem do usuário chegue, mesmo que sessenta dessas setenta e cinco ferramentas nunca sejam chamadas. Conectar todos os servidores MCP disponíveis "por precaução" não é um padrão neutro - é uma cobrança mensal permanente mais um imposto de contexto, pago independentemente de algum deles ser usado ou não.

Não é isso que custa para executar o servidor

Vale a pena separar de forma clara, porque os dois números ficam constantemente confusos: quanto custa construir, hospedar e manter um servidor MCP - coberto no Calculadora de custos do servidor MCP - os gastos com infraestrutura são pagos por quem os opera e não variam de acordo com o quanto uma determinada conversa os utiliza. O imposto neste artigo é uma conta completamente diferente, paga por quem está pagando a fatura da API LLM, que aumenta com sessões e turnos, em vez de esforço de engenharia. Um servidor que custa zero dólares para hospedar em um processo stdio local ainda pode queimar centenas de dólares por mês em tokens de esquema do outro lado do razão. Ambos são reais. Nenhum substitui o outro num orçamento honesto.

O que realmente faríamos com isso

A conclusão

As ferramentas MCP não são caras para ligar. É caro conectá-los, em cada curva, sejam eles chamados ou não – e esse custo é quase invisível porque chega como tokens de entrada comuns em uma conta que já tem muitos deles. O cache reduz o valor do dólar em cerca de 85% e não faz nada para o compartilhamento da janela de contexto, que é o número que realmente degrada uma sessão longa. A correção não custa nada: conecte menos servidores, mantenha a lista estável e verifique o calculadora antes que a contagem de ferramentas ultrapasse o preço estimado.

Metodologia: o tamanho médio do esquema de aproximadamente 1.000 tokens é o número relatado pela comunidade na edição nº 2808 do modelcontextprotocol GitHub, não uma medida de qualquer implantação específica - o tamanho real do esquema varia de acordo com o quão detalhadas são as descrições dos parâmetros de cada ferramenta. O preço (entrada de US$ 3,00 / leitura de cache de US$ 0,30 por 1 milhão de tokens) reflete as taxas publicadas de um modelo da classe Sonnet em agosto de 2026. A tabela trabalhada é um cenário construído destinado a mostrar como os números aumentam com a contagem de ferramentas, não com a telemetria de um sistema de produção. Confirme os preços atuais e suas próprias contagens de turnos/sessões antes de fazer o orçamento.