Publicado em 15 de julho de 2026 · preços de referência, verifique antes de orçamentar
"Quanto custará nosso chatbot de suporte de IA?" é uma das perguntas mais comuns que vemos. A resposta varia 23× dependendo do modelo — e cresce mais rápido do que o esperado à medida que o histórico de conversas se acumula.
| Modelo | US$/1 milhão em | $/1 milhão de saída | Custo por chat | 100 mil bate-papos/mês | Anual |
|---|---|---|---|---|---|
| Gêmeos 2.0 Flash | $0.10 | $0.40 | $0.0043 | $432 | $5,184 |
| GPT-4o mini | $0.15 | $0.60 | $0.0065 | $648 | $7,776 |
| Claude Haiku 4.5 | $0.80 | $4.00 | $0.0374 | $3,744 | $44,928 |
| GPT-4o | $2.50 | $10.00 | $0.1013 | $10,125 | $121,500 |
| Claude Soneto 4 | $3.00 | $15.00 | $0.1258 | $12,576 | $150,912 |
É aqui que a maioria das estimativas de custos do chatbot erram. Eles modelam o custo por mensagem com uma contagem fixa de tokens — mas, na realidade, cada mensagem carrega o histórico completo.
| Mensagem # | Tokens de entrada (incl. histórico) | Tokens de saída | Custo instantâneo | Custo GPT-4o |
|---|---|---|---|---|
| 1 | 550 | 280 | $0.000167 | $0.00418 |
| 2 | 900 | 280 | $0.000202 | $0.00505 |
| 4 | 1,400 | 280 | $0.000252 | $0.00630 |
| 6 | 1,950 | 280 | $0.000307 | $0.00768 |
| 8 (final) | 2,500 | 280 | $0.000362 | $0.00905 |
| Total (8 mensagens) | ~10.800 | ~2.240 | $0.0043 | $0.101 |
Nem todas as consultas de suporte precisam do mesmo modelo. Encaminhe consultas para diferentes níveis:
Um classificador de intenção simples (barato – Flash a aproximadamente US$ 0,002 por chamada de roteamento) pode definir qual camada lida com cada conversa.
Em vez de incluir a transcrição completa em cada mensagem, resuma a conversa após a mensagem 4 e passe um resumo compactado (≈200 tokens) para mensagens 5+. Isso mantém o contexto estável em vez de crescer linearmente.
Efeito: reduz a entrada média por mensagem de 1.350 para aproximadamente 600 tokens – uma redução de 55% nos custos de entrada. No GPT-4o: US$ 10.125 → ~US$ 5.400/mês.
O prompt do sistema e o contexto do FAQ (400 tokens em nosso modelo) são repetidos em cada mensagem. Tanto a Anthropic quanto a OpenAI oferecem cache imediato – tokens de prefixo repetidos são cobrados de 10 a 50% da taxa normal após a primeira solicitação.
Se o prompt do sistema tiver 1.000 tokens e você armazená-lo em cache, você economizará 90% nesses 1.000 tokens em todas as mensagens subsequentes. Em 100 mil bate-papos × 8 mensagens = 800 mil mensagens, são 800 milhões de tokens × US$ 0,10/1 milhão × 90% = US$ 72/mês economizados somente em Flash. No GPT-4o a economia é maior em termos absolutos.
| Escala | Clarão | Combinado (roteamento) | GPT-4o |
|---|---|---|---|
| 10 mil chats/mês (inicialização) | $43 | $164 | $1,013 |
| 100 mil chats/mês (crescimento) | $432 | $1,639 | $10,125 |
| 500 mil chats/mês (escala) | $2,160 | $8,195 | $50,625 |
| 1 milhão de chats/mês (empresarial) | $4,320 | $16,390 | $101,250 |
Com 1 milhão de chats/mês, a diferença entre Flash e GPT-4o é de US$ 97 mil/mês – US$ 1,16 milhão por ano. Mesmo que o Flash exija 15% mais escalações para agentes humanos, a matemática quase sempre favorece o nível de modelo mais barato.
Essa é a verdadeira questão e depende inteiramente do seu caso de uso. Para Resposta a perguntas frequentes, status do pedido, política de devolução, informações de envio — O desempenho do Flash é comparável ao do GPT-4o em avaliações controladas. Para tratamento diferenciado de reclamações, solução de problemas em várias etapas ou situações que exigem raciocínio genuíno sobre casos extremos — os modelos de fronteira têm uma vantagem mensurável.
A abordagem prática: execute o Flash por 30 dias, meça a taxa de escalonamento e o CSAT e compare com sua linha de base. Se o CSAT cair <1 ponto e o escalonamento aumentar <5%, a mudança de modelo é justificada pela economia de custos.
Com 100.000 chats/mês com média de 8 mensagens: Gemini Flash ~$432, GPT-4o mini ~$648, Claude Haiku ~$3.744, GPT-4o ~$10.125. A escolha do modelo é a maior alavanca de custos.
Cada mensagem inclui o histórico completo como tokens de entrada. A mensagem 1 custa aproximadamente 400 tokens de entrada; a mensagem 8 custa aproximadamente 2.500 – um aumento de 6× para o mesmo resultado. Sem o resumo da conversa, os custos aumentam linearmente com a duração do chat.
Para respostas a perguntas frequentes, status de pedidos e perguntas sobre políticas – normalmente sim. Para tratamento diferenciado de reclamações ou solução de problemas complexos — compare primeiro. Muitas equipes executam Flash para 60-70% do volume e escalam para um modelo de fronteira para casos extremos.
Três alavancas principais: (1) roteamento de modelo — use Flash para consultas simples, GPT-4o apenas para consultas complexas; (2) resumo da conversa – compactar o histórico antigo em aproximadamente 200 tokens; (3) cache de prompt – tanto a Anthropic quanto a OpenAI oferecem descontos de 50 a 90% em prefixos de prompt repetidos.