Pubblicato il 15 luglio 2026 · prezzi di riferimento, da verificare prima della stesura del budget
"Quanto costerà il nostro chatbot con supporto AI?" è una delle domande più comuni che vediamo. La risposta varia di 23 volte a seconda del modello e cresce più velocemente del previsto man mano che si accumula la cronologia delle conversazioni.
| Modello | $/1 milione di dollari | $/1 milione in uscita | Costo per chat | 100.000 chat al mese | Annuale |
|---|---|---|---|---|---|
| Gemelli 2.0 Flash | $0.10 | $0.40 | $0.0043 | $432 | $5,184 |
| GPT-4omini | $0.15 | $0.60 | $0.0065 | $648 | $7,776 |
| ClaudeHaiku4.5 | $0.80 | $4.00 | $0.0374 | $3,744 | $44,928 |
| GPT-4o | $2.50 | $10.00 | $0.1013 | $10,125 | $121,500 |
| Claude Sonetto 4 | $3.00 | $15.00 | $0.1258 | $12,576 | $150,912 |
È qui che la maggior parte delle stime sui costi dei chatbot vanno errate. Modellano il costo per messaggio con un conteggio di token fisso, ma in realtà ogni messaggio porta con sé l'intera cronologia.
| Messaggio n. | Token di input (inclusa la cronologia) | Gettoni di uscita | Costo flash | Costo GPT-4o |
|---|---|---|---|---|
| 1 | 550 | 280 | $0.000167 | $0.00418 |
| 2 | 900 | 280 | $0.000202 | $0.00505 |
| 4 | 1,400 | 280 | $0.000252 | $0.00630 |
| 6 | 1,950 | 280 | $0.000307 | $0.00768 |
| 8 (final) | 2,500 | 280 | $0.000362 | $0.00905 |
| Total (8 msg) | ~10,800 | ~2.240 | $0.0043 | $0.101 |
Non tutte le richieste di supporto richiedono lo stesso modello. Instradare le query a diversi livelli:
Un semplice classificatore di intenti (di per sé economico – Flash a ~$ 0,002 per chiamata instradata) può stabilire quale livello gestisce ciascuna conversazione.
Invece di includere la trascrizione completa in ogni messaggio, riassumi la conversazione dopo il messaggio 4 e trasmetti un riepilogo compresso (≈200 token) per i messaggi 5+. Ciò mantiene il contesto stabile anziché crescere in modo lineare.
Effetto: riduce l'input medio per messaggio da 1.350 a ~600 token: una riduzione del 55% dei costi di input. Su GPT-4o: $ 10.125 → ~ $ 5.400/mese.
Il prompt del tuo sistema e il contesto delle FAQ (400 token nel nostro modello) vengono ripetuti in ogni singolo messaggio. Sia Anthropic che OpenAI offrono il caching immediato: i token con prefisso ripetuto vengono fatturati al 10-50% della tariffa normale dopo la prima richiesta.
Se il prompt del tuo sistema è di 1.000 token e lo metti nella cache, risparmi il 90% su quei 1.000 token in tutti i messaggi successivi. Su 100.000 chat × 8 messaggi = 800.000 messaggi, ovvero 800 milioni di token × $ 0,10/1 milione × 90% = $ 72 al mese risparmiati solo su Flash. Su GPT-4o il risparmio è maggiore in termini assoluti.
| Scala | Flash | Misto (percorso) | GPT-4o |
|---|---|---|---|
| 10.000 chat/mese (avvio) | $43 | $164 | $1,013 |
| 100.000 chat/mese (crescita) | $432 | $1,639 | $10,125 |
| 500.000 chat/mese (scala) | $2,160 | $8,195 | $50,625 |
| 1 milione di chat/mese (aziendale) | $4,320 | $16,390 | $101,250 |
Con 1 milione di chat al mese, la differenza tra Flash e GPT-4o è di 97.000 dollari al mese – 1,16 milioni di dollari all'anno. Anche se Flash richiede il 15% in più di escalation agli agenti umani, i calcoli sono quasi sempre a favore del livello di modello più economico.
Questa è la vera domanda e dipende interamente dal caso d'uso. Per Risposte alle domande frequenti, stato dell'ordine, politica di restituzione, informazioni sulla spedizione — Flash ha prestazioni paragonabili a GPT-4o nelle valutazioni controllate. Per gestione sfumata dei reclami, risoluzione dei problemi in più fasi o situazioni che richiedono un ragionamento autentico sui casi limite — i modelli di frontiera presentano un vantaggio misurabile.
L'approccio pratico: esegui Flash per 30 giorni, misura il tasso di escalation e il CSAT, quindi confrontalo con il tuo valore di riferimento. Se il CSAT scende <1 punto e l’escalation aumenta <5%, il cambio di modello è giustificato dal risparmio sui costi.
Con 100.000 chat al mese con una media di 8 messaggi: Gemini Flash ~$432, GPT-4o mini ~$648, Claude Haiku ~$3.744, GPT-4o ~$10.125. La scelta del modello è la principale leva di costo.
Ogni messaggio include la cronologia completa come token di input. Il messaggio 1 costa circa 400 token di input; il messaggio 8 costa ~2.500: un aumento di 6 volte per lo stesso output. Senza il riepilogo delle conversazioni, i costi crescono in modo lineare con la durata della chat.
Per risposte alle domande frequenti, stato dell'ordine e domande sulle norme, in genere sì. Per una gestione più articolata dei reclami o una risoluzione dei problemi complessa, esegui prima il benchmark. Molti team utilizzano Flash per il 60-70% del volume e passano a un modello di frontiera per i casi limite.
Tre leve principali: (1) routing del modello: utilizza Flash per query semplici, GPT-4o solo per quelle complesse; (2) riepilogo delle conversazioni: comprimi la vecchia cronologia in circa 200 token; (3) memorizzazione nella cache dei prompt: sia Anthropic che OpenAI offrono sconti del 50-90% su prefissi di prompt ripetuti.