✓ Última verificação: 15/08/2026· Fonte: página oficial de preços do fornecedor· Monitorado automaticamente — relatar alteração →
Um agente não atende em uma chamada — ele faz um loop: pense, chame uma ferramenta, leia o resultado, pense novamente. Cada loop é uma solicitação cobrada, portanto o custo é multiplicado pelo número de etapas. Insira seu uso para ver a fatura mensal real e o modelo mais barato para o trabalho.
A armadilha com os agentes: uma tarefa que parece uma pergunta envolve, na verdade, de 5 a 20 ligações de LLM. Um chatbot responde uma vez. Um agente raciocina, chama ferramentas e relê seu próprio contexto crescente a cada passo – portanto, o mesmo modelo que custa uma fração de um centavo por mensagem de chat pode custar de 10 a 50 vezes mais por tarefa do agente. Esta calculadora multiplica corretamente.
—
por mês
—por tarefa
—por ano
—Chamadas LLM / mês
Modelos mais baratos para este agente
Mesma carga de trabalho, todos os modelos classificados por custo mensal.
Modelo
Custo/mês
Por tarefa
⚠️ Estimativa usando preços de referência (julho de 2026) e taxas de tabela. O custo real do agente depende muito de quanto contexto você reenvia em cada etapa – os agentes que realimentam o histórico completo aumentam os tokens de entrada a cada loop. Digite sua contagem real de tokens por etapa para obter o valor mais próximo. · Informar preço desatualizado →
Como o custo do agente realmente aumenta
A fórmula é tarefas × etapas × (tokens de entrada × preço de entrada + tokens de saída × preço de saída). O multiplicador que as pessoas esquecem é passos: um agente de pesquisa pode realizar 12 loops, um agente de codificação 20+. E como a maioria dos agentes reenvia a conversa acumulada a cada etapa, inserir tokens por etapa de subida à medida que a tarefa avança — o número inserido acima é a média de todo o loop. O resultado geralmente é pequeno por etapa (uma breve reflexão ou uma chamada de ferramenta), e é por isso que a entrada domina a conta do agente — e por que o cache imediato e o corte de contexto são mais importantes aqui do que em qualquer outro lugar.
Como cortar
Quatro alavancas, em ordem de impacto: (1) roteamento de modelo — utilizar um modelo pequeno para etapas rotineiras e um modelo de fronteira apenas para as etapas difíceis; (2) limite de passo — interromper loops descontrolados; (3) corte de contexto — não reenvie todo o histórico a cada passo; (4) cache imediato para o prompt do sistema estático e definições de ferramentas. Veja o guia de cache rápido e o calculadora de economia de cache. Construindo um chatbot em vez de um agente? Use o calculadora de custos do chatbot. Aplicativo inteiro? O Estimador de custos de aplicativos de IA. Executando mais de um agente na mesma tarefa – padrões de distribuição, debate, supervisor ou enxame? Esta calculadora avalia o preço de um único agente; use o Calculadora de custos de enxame de agentes de IA para ver o multiplicador que esses padrões de orquestração adicionam.
O Calculadora de custos do agente AI estima o gasto mensal de LLM para administrar um agente de IA. Como um agente completa cada tarefa através de vários Etapas do LLM — turnos de raciocínio mais chamadas de ferramentas — o custo de uma tarefa é o custo do token por etapa multiplicado por cada etapa e depois multiplicado novamente pelo volume mensal de tarefas. Os principais motivadores são seus tarefas por mês, o número de Etapas do LLM por tarefa, o média de tokens de entrada e saída por etapa, o modelo você escolhe (que define o preço por token) e qualquer otimização como cache ou modelos mais baratos. Pequenos números por etapa aumentam rapidamente entre etapas e tarefas.
A principal compensação a observar é contagem de passos versus qualidade do modelo. Um modelo mais barato pode precisar de mais etapas de raciocínio ou novas tentativas para concluir uma tarefa, portanto, um preço mais baixo por token nem sempre significa um total mais baixo. Estime o custo de toda a tarefa, não de uma única chamada, e confirme se as contagens de token inseridas refletem prompts reais – instruções longas do sistema e saídas de ferramentas são contadas como entrada em cada etapa.
Perguntas frequentes
Por que um agente de IA custa mais do que uma única chamada de chatbot?
Um agente resolve uma tarefa em muitas chamadas LLM – ele raciocina, chama uma ferramenta, lê o resultado, raciocina novamente e repete. Cada etapa é uma solicitação faturada completa, e o contexto de execução geralmente aumenta a cada etapa, portanto, uma única tarefa pode custar de 5 a 20 vezes mais que uma resposta única do chatbot.
Como faço para reduzir os custos do agente de IA?
Use um modelo mais barato para etapas de rotina e reserve um modelo de fronteira para etapas difíceis, limite o número de etapas por tarefa, reduza o contexto que você reenvia cada etapa e ative o cache de prompt para o prompt do sistema estático e definições de ferramentas que se repetem em cada chamada.