Costo del circuito condiviso
ReAct: riferimento per agente singolo
Albero del pensiero
Dibattito multiagente
Pianificatore/orchestratore + subagenti isolati
—
architettura più economica—architettura più costosa
—divario di costo, più economico → più costoso
—il più caro è questo × più economico
Costo per architettura, stesso compito
Ordinati per costo totale del token, partendo dal più economico. ReAct è contrassegnato come base di riferimento per singolo agente rispetto a cui viene misurato ogni moltiplicatore.
| Architettura | Gettoni totali | Costo | × rispetto al riferimento ReAct |
|---|
Come si collega ad altri strumenti
Questo calcolatore valuta il livello dell'architettura, ovvero la forma del flusso di lavoro dell'agente stesso, che è una domanda diversa rispetto ad altri due strumenti già presenti su questo sito. IL Calcolatore del budget del ciclo dell'agente prezzi il budget per l'iterazione del ciclo di un SINGOLO agente: dato un costo token per ciclo e un tetto di spesa, quanti turni di riflessione-azione-osservazione può permettersi un agente prima di doverlo interrompere. Non effettua mai confronti tra architetture, ma solo tra quanti turni un agente ottiene all'interno di uno schema. IL Calcolatore dei costi del framework AI Agent confronta gli strumenti e il sovraccarico dell'infrastruttura tra i framework (CrewAI rispetto a LangGraph rispetto a un ciclo personalizzato) eseguendo lo STESSO modello di architettura con tubature diverse. Questo calcolatore si trova un livello sopra entrambi: mantiene costanti il framework e il costo del token per loop e confronta invece quattro diversi PATTERN architettonici per risolvere lo stesso compito: ReAct con agente singolo, ramificazione dell'albero del pensiero, dibattito multi-agente e pianificatore/orchestratore con subagenti isolati, perché il modello scelto moltiplica la spesa in token prima che la scelta del framework o il budget del loop entrino in gioco.
Calcolatore del budget del ciclo dell'agenteCalcolatore dei costi del framework AI AgentCalcolatore del costo dello sciame di agenti AIRisparmio immediato nella cache
Come funziona questa calcolatrice
Ognuna delle quattro architetture ha lo stesso prezzo condiviso gettoni per ciclo figura, quindi l'unica cosa che cambia i costi tra loro è la FORMA del flusso di lavoro, non il prezzo per passaggio. Reagire è il riferimento per il singolo agente: reactLoops × tokensPerLoop - un agente, un ciclo, fatto quando è finito. Albero del pensiero moltiplica lo stesso costo per ciclo per entrambi fattore di ramificazione E profondità — branching × depth × tokensPerLoop — perché esplorare 3 rami a 3 livelli di profondità significa eseguire circa 9 cicli di ragionamento invece di uno. Dibattito multiagente gestisce ogni agente di dibattito per i propri turni - agents × rounds × tokensPerLoop — quindi aggiunge i token che il giudice deve leggere: la risposta finale di ogni agente più il ragionamento del giudice, agents × answerTokens + judgeTokens.
Pianificatore/orchestratore è il più coinvolto: l'orchestratore spende il proprio gettoni di pianificazione in primo piano, quindi genera un numero di subagenti, ognuno dei quali esegue il PROPRIO ciclo interno completo in isolamento — subagents × subagentLoops × tokensPerLoop - e ciascuno dei quali riporta solo un compresso riepilogo che l'orchestratore legge, subagents × summaryTokens. Il contesto dell'orchestratore rimane piccolo perché vede sempre e solo i riepiloghi, non le tracce complete dei subagenti, ma la spesa totale dei token A TUTTO IL SISTEMA, che è ciò che viene effettivamente fatturato in ogni chiamata del modello nella pipeline, include comunque ogni token generato internamente da ciascun subagente. Un orchestratore snello non significa un sistema economico: significa che la parte costosa è stata spostata fuori dalla finestra di contesto dell'orchestratore e in una serie di cicli di subagenti paralleli fatturati allo stesso modo. Il costo di ogni architettura lo è totalTokens / 1,000,000 × pricePerMillione il moltiplicatore di ogni modello non ReAct è semplicemente il totale dei token divisi per il totale dei token della linea di base ReAct.
Domande frequenti
Perché il modello di pianificazione/orchestrazione "intelligente" finisce per costare più di un singolo agente ReAct in questo calcolatore?
Perché l'orchestratore snello e il sistema economico sono due cose diverse. Nel modello pianificatore/lavoratore, l'orchestratore centrale rilegge solo un riepilogo compresso da ciascun subagente - poche centinaia di token - il che rende piccolo il PROPRIO contesto dell'orchestratore e lo mantiene molto al di sotto di qualsiasi limite della finestra di contesto. Ma ognuno di questi subagenti esegue ancora il proprio ciclo interno completo di passaggi pensa-agisci-osserva per portare a termine effettivamente la propria parte del compito e ognuno di questi token del ciclo viene generato e fatturato da qualche parte, anche se l'orchestratore non li vede mai direttamente. Con 3 subagenti che eseguono ciascuno 4 loop a 3.000 token per loop, ovvero 36.000 token di lavoro del subagente che si verificano lateralmente, più i token di pianificazione dell'orchestratore e i riepiloghi che ritornano: spesa a livello di sistema che un singolo agente ReAct che esegue 5 loop della stessa attività non deve mai pagare, perché c'è solo un loop in esecuzione, non un loop dell'orchestratore più tre loop di subagente paralleli.
Il dibattito basato sull’albero del pensiero o tra più agenti vale mai il costo aggiuntivo?
Sì, ma il motivo per pagare il moltiplicatore deve basarsi su qualcosa di diverso dal costo grezzo dei token, perché solo sui token entrambi i modelli perdono ogni volta in un singolo ciclo ReAct. L'albero del pensiero guadagna il suo 1,8x (o peggio, con ramificazioni o profondità più elevate) quando un'attività ha uno spazio di soluzione veramente ampio in cui l'impegno prematuro verso un percorso di ragionamento probabilmente produrrà una risposta sbagliata che poi dovrà essere rifatta da zero: i rami extra sono un'assicurazione contro un nuovo tentativo molto più costoso, non un aggiornamento gratuito. Il dibattito tra più agenti guadagna i suoi costi quando l'autocoerenza di un singolo modello è il rischio reale, come nel caso della classificazione ad alto rischio o della revisione contraddittoria, dove il fatto che agenti indipendenti raggiungano le risposte separatamente e poi siano giudicati rileva errori che un singolo passaggio non farebbe. Se l'attività rientra nell'intervallo di affidabilità di un singolo agente, nessuno dei due modelli vale il suo moltiplicatore: stai pagando per un'assicurazione di cui non hai bisogno.
La memorizzazione nella cache dei prompt modifica l'architettura più economica?
Riduce tutti e quattro i costi all'incirca nella stessa proporzione senza riordinarli, perché la memorizzazione nella cache sconta i prefissi ripetuti dei token di input (prompt di sistema, schemi di strumenti, contesto condiviso) e ognuno di questi quattro modelli necessita ancora di quei prefissi reinviati su ogni ciclo, ramo, turno di agente o passaggio di subagente. Ciascuno dei 5 loop di ReAct beneficia in parte della memorizzazione nella cache del prefisso ripetuto, così come i rami dell'albero del pensiero, i round del dibattito per agente e i loop interni di ciascun subagente del pianificatore: lo sconto si applica più o meno uniformemente su tutta la linea anziché favorire la forma di un modello rispetto a un altro. Ciò che la memorizzazione nella cache non fa è modificare l'aritmetica del conteggio dei loop sottostante: un pianificatore che genera 3 subagenti che eseguono ciascuno 4 loop sta ancora generando molti più token totali generati (output) rispetto a un singolo agente ReAct a 5 loop e i token di output in genere non sono affatto idonei per lo sconto sull'input memorizzato nella cache, quindi la classificazione del modello di architettura in questo calcolatore vale indipendentemente dalla configurazione della cache.
In cosa differisce dal calcolatore del budget del loop degli agenti e dal calcolatore dei costi del framework degli agenti AI già presenti su questo sito?
Tutti e tre i token dell'agente di prezzo spendono, ma a livelli diversi dello stesso stack. Il calcolatore del budget del loop dell'agente calcola il budget di un SINGOLO agente per l'iterazione del loop: dato un costo token per loop e un tetto di spesa, quanti turni pensa-agisci-osserva può permettersi un agente prima di doverlo interrompere - non confronta mai tra le architetture, ma solo tra quanti turni ottiene un agente. Il calcolatore dei costi del framework dell'agente AI confronta gli strumenti e il sovraccarico dell'infrastruttura legati all'esecuzione di un determinato carico di lavoro dell'agente su diversi framework, come CrewAI rispetto a LangGraph rispetto a un ciclo personalizzato: lo stesso modello di architettura, prezzato in base a parametri idraulici diversi. Questo calcolatore si trova a un livello superiore rispetto a entrambi: mantiene costante la struttura e il costo per ciclo e confronta invece quattro diversi MODELLI ARCHITETTONICI per risolvere lo stesso compito: ReAct con agente singolo, ramificazione dell'albero del pensiero, dibattito multi-agente e pianificatore/orchestratore con sottoagenti isolati - per dimostrare che il modello scelto moltiplica la spesa in token prima che la scelta del quadro o il budget del ciclo entrino in gioco.