Come funziona questa calcolatrice
IL Calcolatore dell'attribuzione dei costi multi-server MCP inizia moltiplicando ciascun server connesso conteggio degli utensili dal suo token di schema medi per strumento per ottenere i token per turno di quel server, quindi somma la riga di ogni server totalSchemaTokensPerTurno - l'unione che il cliente invia nuovamente ad ogni singolo turno, qualunque sia lo strumento effettivamente chiamato. Moltiplicalo per turni per sessione per ottenere il conteggio dei token dello schema per sessione, quindi entro sessioni al giorno × 30 per ottenere il volume mensile del token dello schema. Quel volume ha un prezzo pari a prezzo di input non memorizzato nella cache o il prezzo di input memorizzato nella cache a seconda dell'attivazione/disattivazione della memorizzazione nella cache, fornendo il titolo del costo mensile dello schema.
La fase di attribuzione è ciò che lo rende diverso da un semplice calcolatore di token: quello di ciascun server quota del totale è i suoi gettoni per turno divisi per i gettoni per turno combinati su ogni server connesso, e il suo costo mensile attribuito è semplicemente il costo mensile dello schema moltiplicato per tale quota. Poiché la condivisione di ogni server ammonta esattamente al 100% dello schema connesso, i costi attribuiti si sommano sempre al costo mensile totale: non vi è alcun costo creato o distrutto dalla suddivisione, ma solo riassegnato. Questo è deliberatamente basato su quanto dello schema connesso rappresenta ciascun server, non la frequenza con cui i suoi strumenti vengono effettivamente invocati - un server può essere la voce più costosa della fattura mentre è completamente inattivo in quella sessione, semplicemente perché rimane connesso con un numero elevato di strumenti e schemi dettagliati. La memorizzazione nella cache immediata modifica l'entità del totale in dollari (in genere uno sconto di circa il 90% una volta che lo stesso prefisso dello schema si ripete turno dopo turno) ma non cambia quale server detiene la quota maggiore: riduce solo il numero accanto ad esso.
Domande frequenti
Perché connettere tre server MCP costa più della somma di quanto costerebbe ciascun server da solo?
Non costa di più per server, ma costa di più per turno di quanto la maggior parte delle persone si aspetti, perché il client non invia solo gli schemi degli strumenti per il server che stai per utilizzare: invia gli schemi per ogni server MCP attualmente connesso a quella sessione, raggruppati in un'unica unione, ad ogni singolo turno. Se colleghi un server MCP GitHub con 26 strumenti, un server MCP Slack con 11 strumenti, un server MCP Postgres con 6 strumenti e un server MCP filesystem con 8 strumenti, il client invia nuovamente lo schema di tutti i 51 strumenti al primo turno, al secondo turno e a ogni turno successivo, indipendentemente da quale strumento viene effettivamente chiamato in quel turno. Tre o quattro server, ciascuno singolarmente economico da gestire, possono sommarsi a un carico utile dello schema di decine di migliaia di token presenti in ogni richiesta prima ancora che la conversazione inizi, la stessa meccanica di unione di strumenti connessi documentata per server singoli pesanti come GitHub, le cui definizioni di strumenti da sole possono arrivare a decine di migliaia di token, semplicemente moltiplicati per quanti server sono collegati nella stessa sessione client.
Se gli strumenti di un server non sono mai stati chiamati in questa sessione, perché viene comunque attribuito un costo?
Perché il costo qui indicato non è il costo della chiamata a uno strumento: è il costo dello schema presente in ogni richiesta, indipendentemente dal fatto che venga utilizzato o meno. Il client non include selettivamente solo gli schemi per gli strumenti che prevede di chiamare; include lo schema completo per ogni strumento su ogni server connesso, ogni turno, e quel blocco di token viene fatturato come normali token di input indipendentemente da ciò che il modello fa effettivamente con esso. Questo calcolatore attribuisce la quota di ciascun server della fattura mensile dello schema in proporzione alla quota di quel server nello schema totale connesso (strumenti per token medi per strumento, diviso per la somma su tutti i server) e non in proporzione alla frequenza con cui i suoi strumenti vengono invocati. Un server con un numero elevato di strumenti e schemi dettagliati può finire per essere responsabile della maggior parte della bolletta mensile anche con zero chiamate effettive, semplicemente rimanendo connesso, mentre un server che usi costantemente ma che espone due piccoli strumenti non costa quasi nulla in confronto. Questa discrepanza tra "costoso da avere connesso" e "costoso da usare" è il punto centrale dell'attribuzione dei prezzi in questo modo invece che in base al volume delle chiamate.
L'attivazione della memorizzazione nella cache dei prompt risolve il problema dei costi dello schema multi-server?
Risolve la grandezza del dollaro, non la forma sottostante del costo. La memorizzazione nella cache consente al primo turno di una sessione di pagare l'intero prezzo di input per il blocco dello schema, quindi rileggere lo stesso blocco identico dalla cache con un forte sconto - in genere circa il 90% di sconto - per ogni turno successivo, purché lo stesso identico set di strumenti rimanga connesso senza nulla di riordinato o modificato durante la sessione. Questo sconto è reale: in una tipica configurazione multi-server può trasformare una fattura mensile da migliaia di dollari in poche centinaia. Ma non cambia quale server sia responsabile della quota maggiore di quella fattura, perché l'attribuzione è ancora proporzionale alla quota di ciascun server dello schema connesso, memorizzato nella cache o meno: un server pesantemente connesso ma usato raramente è ancora l'elemento pubblicitario più grande, solo con un numero inferiore. E la memorizzazione nella cache funziona solo mentre l'elenco degli strumenti rimane identico turno dopo turno; aggiungi, rimuovi o riordina un server connesso a metà sessione e la richiesta successiva perde la cache e paga nuovamente il prezzo intero.
In che cosa differisce dal calcolatore dei costi del server MCP e dal calcolatore dei costi generali del token dello schema dello strumento MCP già presenti su questo sito?
Tutti e tre fissano un prezzo correlato a MCP ma nessuno di essi si sovrappone. Il calcolatore dei costi del server MCP valuta quanto costa costruire, ospitare e mantenere un server MCP come infrastruttura: ore di progettazione, fattura di hosting mensile, trattenuta per la manutenzione, un numero che non cambia in base a come viene utilizzato da qualsiasi conversazione LLM. Il calcolatore del sovraccarico del token dello schema dello strumento MCP calcola la tassa sui token ricorrente degli schemi dello strumento di un server che vengono reinviati a ogni turno di una sessione, la versione per server singolo della tassa sullo schema. Questo calcolatore è la versione multi-server: modella ciò che accade quando si connette più di un server MCP alla stessa sessione client contemporaneamente, in cui il client invia nuovamente l'unione degli schemi di tutti i server connessi insieme ad ogni turno, quindi divide la fattura mensile combinata per la quota di ciascun server dello schema totale connesso: il problema di attribuzione che esiste solo quando più di un server è nella stanza.