Como funciona esta calculadora
Cada uma das quatro arquiteturas tem o mesmo preço compartilhado tokens por loop figura, então a única coisa que altera o custo entre eles é a FORMA do fluxo de trabalho, não o preço por etapa. Reagir é a linha de base do agente único: reactLoops × tokensPerLoop — um agente, um loop, concluído quando estiver concluído. Árvore do pensamento multiplica o mesmo custo por loop por ambos fator de ramificação e profundidade — branching × depth × tokensPerLoop - porque explorar 3 ramos em 3 níveis de profundidade significa executar cerca de 9 loops de raciocínio em vez de um. Debate multiagente dirige cada agente de debate para suas próprias rodadas - agents × rounds × tokensPerLoop — em seguida, adiciona os tokens que o juiz deve ler: a resposta final de cada agente mais o raciocínio do próprio juiz, agents × answerTokens + judgeTokens.
Planejador/orquestrador é o mais envolvido: o orquestrador gasta seu próprio tokens de planejamento na frente, então gera uma série de subagentes, cada um dos quais executa seu PRÓPRIO loop interno completo isoladamente - subagents × subagentLoops × tokensPerLoop - e cada um deles reporta apenas um arquivo compactado resumo que o orquestrador lê, subagents × summaryTokens. O próprio contexto do orquestrador permanece pequeno porque ele vê apenas os resumos, não os rastreamentos completos dos subagentes - mas o gasto total de token em TODO O SISTEMA, que é o que realmente é cobrado em cada chamada de modelo no pipeline, ainda inclui cada token que cada subagente gerou internamente. Um orquestrador enxuto não significa um sistema barato: significa que a parte cara foi movida para fora da janela de contexto do orquestrador e para um conjunto de loops de subagentes paralelos que são cobrados da mesma forma. O custo de cada arquitetura é totalTokens / 1,000,000 × pricePerMillion, e o multiplicador de cada padrão não ReAct é simplesmente seu total de tokens dividido pelo total de tokens da linha de base do ReAct.
Perguntas frequentes
Por que o padrão planejador/orquestrador “inteligente” acaba custando mais do que um único agente ReAct nesta calculadora?
Porque o orquestrador ser enxuto e o sistema barato são duas coisas diferentes. No padrão planejador/trabalhador, o orquestrador central apenas lê um resumo compactado de cada subagente — algumas centenas de tokens — o que torna o contexto PRÓPRIO do orquestrador pequeno e o mantém bem abaixo de qualquer limite de janela de contexto. Mas cada um desses subagentes ainda executa seu próprio loop interno completo de etapas de pensar, agir e observar para realmente realizar sua parte da tarefa, e cada um desses tokens de loop é gerado e cobrado em algum lugar, mesmo que o orquestrador nunca os veja diretamente. Com 3 subagentes, cada um executando 4 loops a 3.000 tokens por loop, ou seja, 36.000 tokens de trabalho de subagente acontecendo paralelamente, mais os tokens de planejamento do próprio orquestrador e os resumos retornando - gastos em todo o sistema que um único agente ReAct fazendo 5 loops da mesma tarefa nunca precisa pagar, porque há apenas um loop em execução, não um loop de orquestrador mais três loops de subagentes paralelos.
Será que o debate sobre a árvore do pensamento ou sobre vários agentes vale o custo extra?
Sim, mas o argumento para pagar o multiplicador deve basear-se em algo diferente do custo bruto do token, porque apenas nos tokens ambos os padrões perdem para um único loop ReAct todas as vezes. A árvore do pensamento ganha 1,8x (ou pior, em ramificações ou profundidades mais altas) quando uma tarefa tem um espaço de solução genuinamente grande, onde o comprometimento prematuro com um caminho de raciocínio provavelmente produzirá uma resposta errada que terá que ser refeita do zero - as ramificações extras são uma garantia contra uma nova tentativa muito mais cara, não uma atualização gratuita. O debate multiagente tem seu custo quando a autoconsistência de um único modelo é o risco real, como classificação de alto risco ou revisão contraditória, onde fazer com que agentes independentes cheguem às respostas separadamente e depois sejam julgados detecta erros que uma passagem individual não perceberia. Se a tarefa estiver dentro da faixa confiável de um único agente, nenhum dos padrões vale seu multiplicador – você está pagando por um seguro desnecessário.
O cache imediato altera qual arquitetura é mais barata?
Ele reduz todos os quatro custos aproximadamente na mesma proporção sem reordená-los, porque o armazenamento em cache desconta prefixos repetidos de token de entrada (prompts do sistema, esquemas de ferramentas, contexto compartilhado) e cada um desses quatro padrões ainda precisa que esses prefixos sejam reenviados em cada loop, ramificação, turno do agente ou etapa do subagente. Cada um dos 5 loops do ReAct se beneficia parcialmente do cache do prefixo repetido, assim como os ramos da árvore de pensamento, as rodadas de debate por agente e os loops internos de cada subagente planejador - o desconto se aplica de maneira aproximadamente uniforme em todos os níveis, em vez de favorecer a forma de um padrão em detrimento de outro. O que o cache não faz é alterar a aritmética de contagem de loops subjacente: um planejador que gera 3 subagentes, cada um executando 4 loops, ainda está gerando muito mais tokens totais gerados (saída) do que um único agente ReAct de 5 loops, e os tokens de saída normalmente não são elegíveis para o desconto de entrada em cache, portanto, a classificação do padrão de arquitetura nesta calculadora é válida independentemente da sua configuração de cache.
Como isso difere da calculadora de orçamento de loop de agente e da calculadora de custos da estrutura de agente de IA já existentes neste site?
Todos os três tokens do agente de preço são gastos, mas em camadas diferentes da mesma pilha. A calculadora de orçamento de loop de agente avalia o orçamento de iteração de loop de um ÚNICO agente - dado um custo de token por loop e um teto de gastos, quantas voltas pensar-agir-observar um agente pode pagar antes de ter que interrompê-lo - nunca se compara entre arquiteturas, apenas quantas voltas um agente recebe. A calculadora de custos da estrutura do agente de IA compara a sobrecarga de ferramentas e infraestrutura da execução de uma determinada carga de trabalho do agente em diferentes estruturas, como CrewAI versus LangGraph versus um loop personalizado – o mesmo padrão de arquitetura, com preços sob diferentes encanamentos. Esta calculadora fica uma camada acima de ambos: ela mantém a estrutura e o custo por loop constantes e, em vez disso, compara quatro PADRÕES DE ARQUITETURA diferentes para resolver a mesma tarefa - ReAct de agente único, ramificação de árvore de pensamento, debate multiagente e planejador / orquestrador com subagentes isolados - para mostrar que o padrão que você escolhe multiplica seu gasto de token antes que a escolha da estrutura ou o orçamento de loop entrem em cena.