A armadilha com os agentes: uma tarefa que parece uma pergunta envolve, na verdade, de 5 a 20 ligações de LLM. Um chatbot responde uma vez. Um agente raciocina, chama ferramentas e relê seu próprio contexto crescente a cada passo – portanto, o mesmo modelo que custa uma fração de um centavo por mensagem de chat pode custar de 10 a 50 vezes mais por tarefa do agente. Esta calculadora multiplica corretamente.
Modelos mais baratos para este agente
Mesma carga de trabalho, todos os modelos classificados por custo mensal.
| Modelo | Custo/mês | Por tarefa |
|---|
Como o custo do agente realmente aumenta
A fórmula é tarefas × etapas × (tokens de entrada × preço de entrada + tokens de saída × preço de saída). O multiplicador que as pessoas esquecem é passos: um agente de pesquisa pode realizar 12 loops, um agente de codificação 20+. E como a maioria dos agentes reenvia a conversa acumulada a cada etapa, inserir tokens por etapa de subida à medida que a tarefa avança — o número inserido acima é a média de todo o loop. O resultado geralmente é pequeno por etapa (uma breve reflexão ou uma chamada de ferramenta), e é por isso que a entrada domina a conta do agente — e por que o cache imediato e o corte de contexto são mais importantes aqui do que em qualquer outro lugar.
Como cortar
Quatro alavancas, em ordem de impacto: (1) roteamento de modelo — utilizar um modelo pequeno para etapas rotineiras e um modelo de fronteira apenas para as etapas difíceis; (2) limite de passo — interromper loops descontrolados; (3) corte de contexto — não reenvie todo o histórico a cada passo; (4) cache imediato para o prompt do sistema estático e definições de ferramentas. Veja o guia de cache rápido e o calculadora de economia de cache. Construindo um chatbot em vez de um agente? Use o calculadora de custos do chatbot. Aplicativo inteiro? O Estimador de custos de aplicativos de IA. Executando mais de um agente na mesma tarefa – padrões de distribuição, debate, supervisor ou enxame? Esta calculadora avalia o preço de um único agente; use o Calculadora de custos de enxame de agentes de IA para ver o multiplicador que esses padrões de orquestração adicionam.