Como funciona esta calculadora
O Calculadora de atribuição de custos multiservidor MCP começa multiplicando cada servidor conectado contagem de ferramentas por seu média de tokens de esquema por ferramenta para obter os tokens por turno desse servidor e, em seguida, soma cada linha do servidor em totalSchemaTokensPerTurn - a união que o cliente reenvia a cada turno, qualquer que seja a ferramenta realmente chamada. Multiplique isso por turnos por sessão para obter a contagem de tokens do esquema por sessão, então por sessões por dia × 30 para obter o volume mensal do token do esquema. Esse volume é cotado no preço de entrada sem cache ou o preço de entrada em cache dependendo da alternância de cache, fornecendo o título mensal do custo do esquema.
A etapa de atribuição é o que torna isso diferente de uma calculadora de token simples: o valor de cada servidor participação no total são seus próprios tokens por turno divididos pelos tokens por turno combinados em cada servidor conectado, e seu custo mensal atribuído é simplesmente o custo mensal do esquema multiplicado por essa parcela. Como a participação de cada servidor equivale exatamente a 100% do esquema conectado, os custos atribuídos sempre somam o custo mensal total — não há custo criado ou destruído pela divisão, apenas reatribuído. Isto é deliberadamente baseado em quanto do esquema conectado cada servidor representa, e não com que frequência suas ferramentas são realmente invocadas - um servidor pode ser o item de linha mais caro em sua conta enquanto fica completamente ocioso naquela sessão, simplesmente porque permanece conectado a uma grande contagem de ferramentas e esquemas detalhados. O cache imediato altera a magnitude em dólares do total (normalmente em torno de um desconto de 90%, uma vez que o prefixo de esquema idêntico se repete turno a turno), mas não altera qual servidor detém a maior parcela – apenas diminui o número próximo a ele.
Perguntas frequentes
Por que conectar três servidores MCP custa mais do que a soma do custo de cada servidor sozinho?
Não custa mais por servidor, mas custa mais por turno do que a maioria das pessoas espera, porque o cliente não envia apenas os esquemas de ferramentas para o servidor que você está prestes a usar — ele envia os esquemas para cada servidor MCP atualmente conectado a essa sessão, agrupados em uma única união, em cada turno. Se você conectar um servidor GitHub MCP com 26 ferramentas, um servidor Slack MCP com 11 ferramentas, um servidor Postgres MCP com 6 ferramentas e um servidor MCP de sistema de arquivos com 8 ferramentas, o cliente reenviará o esquema de todas as 51 ferramentas no turno um, no turno dois e em todos os turnos seguintes, independentemente de qual ferramenta realmente for chamada naquele turno. Três ou quatro servidores, cada um individualmente barato para executar, podem somar uma carga útil de esquema de dezenas de milhares de tokens em cada solicitação antes mesmo de a conversa começar, a mesma mecânica de união de ferramentas conectadas documentada para servidores únicos pesados como o GitHub, cujas definições de ferramentas por si só podem chegar a dezenas de milhares de tokens, apenas multiplicadas por quantos servidores estiverem conectados à mesma sessão do cliente.
Se as ferramentas de um servidor nunca foram chamadas nesta sessão, por que ainda é atribuído um custo?
Porque o custo avaliado aqui não é o custo de chamar uma ferramenta - é o custo do esquema presente em cada solicitação, seja ele usado ou não. O cliente não inclui seletivamente apenas os esquemas das ferramentas que espera chamar; inclui o esquema completo de cada ferramenta em cada servidor conectado, em cada turno, e esse bloco de tokens é cobrado como tokens de entrada comuns, independentemente do que o modelo realmente faz com ele. Esta calculadora atribui a participação de cada servidor na conta mensal do esquema proporcionalmente à participação desse servidor no esquema total conectado - ferramentas multiplicadas pela média de tokens por ferramenta, dividida pela soma de todos os servidores - e não proporcionalmente à frequência com que suas ferramentas são invocadas. Um servidor com uma grande quantidade de ferramentas e esquemas detalhados pode acabar sendo responsável pela maior parte de sua fatura mensal, mesmo sem nenhuma chamada real, simplesmente permanecendo conectado, enquanto um servidor que você usa constantemente, mas que expõe duas pequenas ferramentas, custa quase nada em comparação. Essa incompatibilidade entre “caro para se conectar” e “caro para usar” é o principal motivo da atribuição de preços dessa forma, e não por volume de chamadas.
Ativar o cache de prompt resolve o problema de custo do esquema multiservidor?
Resolve a magnitude do dólar, não a forma subjacente do custo. O cache permite que o primeiro turno de uma sessão pague o preço total de entrada pelo bloco de esquema e, em seguida, leia esse bloco idêntico de volta do cache com um grande desconto - normalmente em torno de 90% de desconto - para cada turno seguinte, desde que exatamente o mesmo conjunto de ferramentas permaneça conectado sem nada reordenado ou alterado no meio da sessão. Esse desconto é real: em uma configuração típica de vários servidores, ele pode transformar uma conta mensal de milhares de dólares em algumas centenas. Mas isso não muda qual servidor é responsável pela maior parcela dessa conta, porque a atribuição ainda é proporcional à participação de cada servidor no esquema conectado, armazenado em cache ou não – um servidor pesado conectado, mas raramente usado, ainda é o maior item de linha, apenas em um número menor. E o cache só funciona enquanto a lista de ferramentas permanece idêntica passo a passo; adicione, remova ou reordene um servidor conectado no meio da sessão e a próxima solicitação perderá o cache e pagará o preço total novamente.
Como isso difere da calculadora de custos do servidor MCP e da calculadora de sobrecarga de token de esquema da ferramenta MCP já neste site?
Todos os três têm preços relacionados ao MCP, mas nenhum deles se sobrepõe. A calculadora de custos do servidor MCP avalia quanto custa construir, hospedar e manter um servidor MCP como infraestrutura – horas de engenharia, uma conta mensal de hospedagem, retentor de manutenção – um número que não muda com base em como qualquer conversa LLM o utiliza. A calculadora de sobrecarga de token de esquema de ferramenta MCP avalia o imposto de token recorrente dos esquemas de ferramenta de um servidor sendo reenviados a cada turno de uma sessão, a versão de servidor único do imposto de esquema. Esta calculadora é a versão multi-servidor: ela modela o que acontece quando você conecta mais de um servidor MCP à mesma sessão do cliente ao mesmo tempo, onde o cliente reenvia a união dos esquemas de todos os servidores conectados a cada turno e, em seguida, divide a fatura mensal combinada de volta pela participação de cada servidor no esquema total conectado - o problema de atribuição que só existe quando mais de um servidor está na sala.