HomeBlog › Costo di 100.000 chat di supporto

Quanto costano 100.000 chat di assistenza clienti con diversi LLM

Pubblicato il 15 luglio 2026 · prezzi di riferimento, da verificare prima della stesura del budget

"Quanto costerà il nostro chatbot con supporto AI?" è una delle domande più comuni che vediamo. La risposta varia di 23 volte a seconda del modello e cresce più velocemente del previsto man mano che si accumula la cronologia delle conversazioni.

Le ipotesi

Queste sono medie realistiche. L'utilizzo effettivo del token dipende dalla lunghezza del prompt del sistema, dal contesto delle domande frequenti, dalla politica di escalation e dalla frequenza con cui riepiloghi la cronologia.

Costo per chat e totale mensile

Modello$/1 milione di dollari$/1 milione in uscitaCosto per chat100.000 chat al meseAnnuale
Gemelli 2.0 Flash$0.10$0.40$0.0043$432$5,184
GPT-4omini$0.15$0.60$0.0065$648$7,776
ClaudeHaiku4.5$0.80$4.00$0.0374$3,744$44,928
GPT-4o$2.50$10.00$0.1013$10,125$121,500
Claude Sonetto 4$3.00$15.00$0.1258$12,576$150,912
Gemelli Flash/mese
$432
GPT-4o/mese
$10,125
Differenza
23×
Risparmio annuale flash rispetto a GPT-4o
$ 116k

L'effetto della cronologia delle conversazioni

È qui che la maggior parte delle stime sui costi dei chatbot vanno errate. Modellano il costo per messaggio con un conteggio di token fisso, ma in realtà ogni messaggio porta con sé l'intera cronologia.

Messaggio n.Token di input (inclusa la cronologia)Gettoni di uscitaCosto flashCosto GPT-4o
1550280$0.000167$0.00418
2900280$0.000202$0.00505
41,400280$0.000252$0.00630
61,950280$0.000307$0.00768
8 (final)2,500280$0.000362$0.00905
Total (8 msg)~10,800~2.240$0.0043$0.101
Il messaggio 8 costa 2,2 volte di più del messaggio 1 su qualsiasi modello, puramente dall'accumulo di contesto. Per flussi di supporto lunghi (reimpostazione della password + ricerca dell'account + cronologia degli ordini = 15+ messaggi), i costi aumentano ulteriormente. Una chat da 15 messaggi su GPT-4o costa circa $ 0,22 per conversazione.

Tre leve per tagliare i costi

1. Routing del modello (leva più grande)

Non tutte le richieste di supporto richiedono lo stesso modello. Instradare le query a diversi livelli:

Un semplice classificatore di intenti (di per sé economico – Flash a ~$ 0,002 per chiamata instradata) può stabilire quale livello gestisce ciascuna conversazione.

2. Riepilogo della conversazione

Invece di includere la trascrizione completa in ogni messaggio, riassumi la conversazione dopo il messaggio 4 e trasmetti un riepilogo compresso (≈200 token) per i messaggi 5+. Ciò mantiene il contesto stabile anziché crescere in modo lineare.

Effetto: riduce l'input medio per messaggio da 1.350 a ~600 token: una riduzione del 55% dei costi di input. Su GPT-4o: $ 10.125 → ~ $ 5.400/mese.

3. Memorizzazione rapida nella cache

Il prompt del tuo sistema e il contesto delle FAQ (400 token nel nostro modello) vengono ripetuti in ogni singolo messaggio. Sia Anthropic che OpenAI offrono il caching immediato: i token con prefisso ripetuto vengono fatturati al 10-50% della tariffa normale dopo la prima richiesta.

Se il prompt del tuo sistema è di 1.000 token e lo metti nella cache, risparmi il 90% su quei 1.000 token in tutti i messaggi successivi. Su 100.000 chat × 8 messaggi = 800.000 messaggi, ovvero 800 milioni di token × $ 0,10/1 milione × 90% = $ 72 al mese risparmiati solo su Flash. Su GPT-4o il risparmio è maggiore in termini assoluti.

Cosa significa questo per il tuo budget

ScalaFlashMisto (percorso)GPT-4o
10.000 chat/mese (avvio)$43$164$1,013
100.000 chat/mese (crescita)$432$1,639$10,125
500.000 chat/mese (scala)$2,160$8,195$50,625
1 milione di chat/mese (aziendale)$4,320$16,390$101,250

Con 1 milione di chat al mese, la differenza tra Flash e GPT-4o è di 97.000 dollari al mese – 1,16 milioni di dollari all'anno. Anche se Flash richiede il 15% in più di escalation agli agenti umani, i calcoli sono quasi sempre a favore del livello di modello più economico.

La qualità è abbastanza buona su Flash?

Questa è la vera domanda e dipende interamente dal caso d'uso. Per Risposte alle domande frequenti, stato dell'ordine, politica di restituzione, informazioni sulla spedizione — Flash ha prestazioni paragonabili a GPT-4o nelle valutazioni controllate. Per gestione sfumata dei reclami, risoluzione dei problemi in più fasi o situazioni che richiedono un ragionamento autentico sui casi limite — i modelli di frontiera presentano un vantaggio misurabile.

L'approccio pratico: esegui Flash per 30 giorni, misura il tasso di escalation e il CSAT, quindi confrontalo con il tuo valore di riferimento. Se il CSAT scende <1 punto e l’escalation aumenta <5%, il cambio di modello è giustificato dal risparmio sui costi.

Prezzi di riferimento, luglio 2026. Presuppongono tariffe pubbliche standard; i prezzi aziendali potrebbero differire. Verifica su Confronto prezzi LLM o la pagina dei prezzi del fornitore. Trovato un errore? Segnalatelo →

Domande frequenti

Quanto costa al mese un chatbot di assistenza clienti AI?

Con 100.000 chat al mese con una media di 8 messaggi: Gemini Flash ~$432, GPT-4o mini ~$648, Claude Haiku ~$3.744, GPT-4o ~$10.125. La scelta del modello è la principale leva di costo.

Perché la cronologia delle conversazioni rende costosi i chatbot?

Ogni messaggio include la cronologia completa come token di input. Il messaggio 1 costa circa 400 token di input; il messaggio 8 costa ~2.500: un aumento di 6 volte per lo stesso output. Senza il riepilogo delle conversazioni, i costi crescono in modo lineare con la durata della chat.

Gemini Flash è abbastanza buono per l'assistenza clienti?

Per risposte alle domande frequenti, stato dell'ordine e domande sulle norme, in genere sì. Per una gestione più articolata dei reclami o una risoluzione dei problemi complessa, esegui prima il benchmark. Molti team utilizzano Flash per il 60-70% del volume e passano a un modello di frontiera per i casi limite.

Come posso ridurre i costi del chatbot AI?

Tre leve principali: (1) routing del modello: utilizza Flash per query semplici, GPT-4o solo per quelle complesse; (2) riepilogo delle conversazioni: comprimi la vecchia cronologia in circa 200 token; (3) memorizzazione nella cache dei prompt: sia Anthropic che OpenAI offrono sconti del 50-90% su prefissi di prompt ripetuti.