HomeBlog › Custo de 100 mil chats de suporte

Quanto custam 100.000 chats de suporte ao cliente com diferentes LLMs

Publicado em 15 de julho de 2026 · preços de referência, verifique antes de orçamentar

"Quanto custará nosso chatbot de suporte de IA?" é uma das perguntas mais comuns que vemos. A resposta varia 23× dependendo do modelo — e cresce mais rápido do que o esperado à medida que o histórico de conversas se acumula.

The assumptions

Estas são médias realistas. O uso real do token depende da duração do prompt do sistema, do contexto das perguntas frequentes, da política de escalonamento e da frequência com que você resume o histórico.

Custo por chat e total mensal

ModeloUS$/1 milhão em$/1 milhão de saídaCusto por chat100 mil bate-papos/mêsAnual
Gêmeos 2.0 Flash$0.10$0.40$0.0043$432$5,184
GPT-4o mini$0.15$0.60$0.0065$648$7,776
Claude Haiku 4.5$0.80$4.00$0.0374$3,744$44,928
GPT-4o$2.50$10.00$0.1013$10,125$121,500
Claude Soneto 4$3.00$15.00$0.1258$12,576$150,912
Gêmeos Flash/mês
$432
GPT-4o/month
$10,125
Diferença
23×
Economia anual de Flash vs GPT-4o
US$ 116 mil

O efeito do histórico de conversas

É aqui que a maioria das estimativas de custos do chatbot erram. Eles modelam o custo por mensagem com uma contagem fixa de tokens — mas, na realidade, cada mensagem carrega o histórico completo.

Mensagem #Tokens de entrada (incl. histórico)Tokens de saídaCusto instantâneoCusto GPT-4o
1550280$0.000167$0.00418
2900280$0.000202$0.00505
41,400280$0.000252$0.00630
61,950280$0.000307$0.00768
8 (final)2,500280$0.000362$0.00905
Total (8 mensagens)~10.800~2.240$0.0043$0.101
A mensagem 8 custa 2,2× mais que a mensagem 1 em qualquer modelo - puramente por acumulação de contexto. Para fluxos de suporte longos (redefinição de senha + consulta de conta + histórico de pedidos = mais de 15 mensagens), os custos aumentam ainda mais. Um bate-papo de 15 mensagens no GPT-4o custa cerca de US$ 0,22 por conversa.

Três alavancas para cortar custos

1. Roteamento de modelo (maior alavanca)

Nem todas as consultas de suporte precisam do mesmo modelo. Encaminhe consultas para diferentes níveis:

Um classificador de intenção simples (barato – Flash a aproximadamente US$ 0,002 por chamada de roteamento) pode definir qual camada lida com cada conversa.

2. Conversation summarization

Em vez de incluir a transcrição completa em cada mensagem, resuma a conversa após a mensagem 4 e passe um resumo compactado (≈200 tokens) para mensagens 5+. Isso mantém o contexto estável em vez de crescer linearmente.

Efeito: reduz a entrada média por mensagem de 1.350 para aproximadamente 600 tokens – uma redução de 55% nos custos de entrada. No GPT-4o: US$ 10.125 → ~US$ 5.400/mês.

3. Cache de prompt

O prompt do sistema e o contexto do FAQ (400 tokens em nosso modelo) são repetidos em cada mensagem. Tanto a Anthropic quanto a OpenAI oferecem cache imediato – tokens de prefixo repetidos são cobrados de 10 a 50% da taxa normal após a primeira solicitação.

Se o prompt do sistema tiver 1.000 tokens e você armazená-lo em cache, você economizará 90% nesses 1.000 tokens em todas as mensagens subsequentes. Em 100 mil bate-papos × 8 mensagens = 800 mil mensagens, são 800 milhões de tokens × US$ 0,10/1 milhão × 90% = US$ 72/mês economizados somente em Flash. No GPT-4o a economia é maior em termos absolutos.

O que isso significa para o seu orçamento

EscalaClarãoCombinado (roteamento)GPT-4o
10 mil chats/mês (inicialização)$43$164$1,013
100 mil chats/mês (crescimento)$432$1,639$10,125
500 mil chats/mês (escala)$2,160$8,195$50,625
1 milhão de chats/mês (empresarial)$4,320$16,390$101,250

Com 1 milhão de chats/mês, a diferença entre Flash e GPT-4o é de US$ 97 mil/mês – US$ 1,16 milhão por ano. Mesmo que o Flash exija 15% mais escalações para agentes humanos, a matemática quase sempre favorece o nível de modelo mais barato.

A qualidade é boa o suficiente no Flash?

Essa é a verdadeira questão e depende inteiramente do seu caso de uso. Para Resposta a perguntas frequentes, status do pedido, política de devolução, informações de envio — O desempenho do Flash é comparável ao do GPT-4o em avaliações controladas. Para tratamento diferenciado de reclamações, solução de problemas em várias etapas ou situações que exigem raciocínio genuíno sobre casos extremos — os modelos de fronteira têm uma vantagem mensurável.

A abordagem prática: execute o Flash por 30 dias, meça a taxa de escalonamento e o CSAT e compare com sua linha de base. Se o CSAT cair <1 ponto e o escalonamento aumentar <5%, a mudança de modelo é justificada pela economia de custos.

Preços de referência, julho de 2026. Estes assumem taxas públicas padrão – os preços empresariais podem ser diferentes. Verifique em Comparação de preços de LLM ou a página de preços do provedor. Encontrou um erro? Denuncie →

Perguntas frequentes

Quanto custa um chatbot de suporte ao cliente com IA por mês?

Com 100.000 chats/mês com média de 8 mensagens: Gemini Flash ~$432, GPT-4o mini ~$648, Claude Haiku ~$3.744, GPT-4o ~$10.125. A escolha do modelo é a maior alavanca de custos.

Por que o histórico de conversas torna os chatbots caros?

Cada mensagem inclui o histórico completo como tokens de entrada. A mensagem 1 custa aproximadamente 400 tokens de entrada; a mensagem 8 custa aproximadamente 2.500 – um aumento de 6× para o mesmo resultado. Sem o resumo da conversa, os custos aumentam linearmente com a duração do chat.

O Gemini Flash é bom o suficiente para suporte ao cliente?

Para respostas a perguntas frequentes, status de pedidos e perguntas sobre políticas – normalmente sim. Para tratamento diferenciado de reclamações ou solução de problemas complexos — compare primeiro. Muitas equipes executam Flash para 60-70% do volume e escalam para um modelo de fronteira para casos extremos.

Como posso reduzir os custos do chatbot de IA?

Três alavancas principais: (1) roteamento de modelo — use Flash para consultas simples, GPT-4o apenas para consultas complexas; (2) resumo da conversa – compactar o histórico antigo em aproximadamente 200 tokens; (3) cache de prompt – tanto a Anthropic quanto a OpenAI oferecem descontos de 50 a 90% em prefixos de prompt repetidos.