Pubblicato il 08-07-2026 · numeri di riferimento, verificare prima della stesura del budget
Quando crei un chatbot con qualsiasi API LLM, ogni messaggio che invii include il file cronologia completa delle conversazioni come input. Non solo l'ultima domanda dell'utente: tutti i turni precedenti, ogni risposta dell'assistente, tutto. È così che i LLM mantengono il contesto. È anche il modo in cui i tuoi costi si trasformano silenziosamente in qualcosa di sorprendente.
Entro il messaggio 30 in una singola conversazione, il conteggio dei token di input è cresciuto da circa 1.150 token a oltre 11.000. A Gettoni di input da $ 5/1 milione (Prezzi GPT-4o), quella risposta ti costa quasi 7 volte di più rispetto alla prima.
Supponiamo che il tuo chatbot abbia un prompt di sistema da 1.000 token, che gli utenti inviino messaggi in media per 150 token e che il modello risponda con circa 200 token ogni volta. A turno k:
input(k) = 1.000 (sistema) + (k−1) × (150 + 200) (turni precedenti) + 150 (messaggio corrente)
Questo semplifica 800 + 350k. Il costo aumenta linearmente ad ogni turno, poiché ogni turno aggiunge 350 gettoni a ogni chiamata futura per sempre.
| Giro | Gettoni di input | Input cost ($5/1M) | Total turn cost |
|---|---|---|---|
| 1 | 1,150 | $0.0058 | $0.009 |
| 5 | 2,550 | $0.0128 | $0.016 |
| 10 | 4,300 | $0.0215 | $0.025 |
| 20 | 7,800 | $0.039 | $0.042 |
| 30 | 11,300 | $0.0565 | $0.060 |
I prezzi sono stime di riferimento, luglio 2026. Segnala prezzo obsoleto →
Output: 200 tokens × $15/1M = $0.003 per turn. Model: GPT-4o ($5/$15 reference pricing).
Turn 30 costs $0.060, turn 1 costs $0.009 — a 6.8× difference for the same 150-token user question and 200-token reply.
Sommando tutti i 30 turni: l'input totale durante la conversazione è 186.750 gettoni. Costo totale:
Se l'API fosse stateless e ogni chiamata inviasse solo il turno corrente (1.150 token in ingresso), gli stessi 30 turni costerebbero 30 × $ 0,009 = $0.27. La cronologia delle conversazioni aggiunge $ 0,75 in costi di input aggiuntivi — soldi spesi rileggendo ciò che il modello aveva già elaborato.
10,000 users per day, each averaging 15 turns:
| Daily cost | Costo mensile | |
|---|---|---|
| 15-turn conversations (with history) | $1,840 | $55,200 |
| Stateless (hypothetical, no history) | $810 | $24,300 |
| La storia in alto | $1,030 | $30,900 |
Il sovraccarico della cronologia non è un bug di fatturazione. È il costo strutturale della creazione di un'intelligenza artificiale conversazionale su un'API che determina il prezzo di ogni token su ogni chiamata. La maggior parte dei team lo scopre quando arriva la fattura di fine mese.
1. Elimina i vecchi messaggi. Mantieni solo gli ultimi N turni (ad esempio, 5–8). Funziona bene per gli assistenti di domande e risposte fattuali in cui il vecchio contesto raramente conta. Soluzione più economica, implementata in un pomeriggio. Trade-off: il modello dimentica il contesto iniziale.
2. Comprimere con un riepilogo. Dopo ogni 5-10 turni, chiama il modello una volta per riassumere la conversazione effettuata fino a quel momento. Sostituisci la cronologia grezza con il riepilogo. Costo: una chiamata extra ogni N turni. Vantaggio: il sovraccarico della cronologia rimane quasi invariato indipendentemente dalla durata della conversazione.
3. Finestra scorrevole con filtro semantico. Mantieni sempre le svolte recenti e includi selettivamente solo le svolte più vecchie semanticamente rilevanti utilizzando gli incorporamenti. Più complesso ma preserva il contesto chiave senza costi storici completi. Vale la pena implementarlo su larga scala per il supporto o gli assistenti di ricerca.
4. Memorizzazione rapida nella cache. Su Claude e Gemini, contrassegnare il prompt del sistema statico come memorizzabile nella cache offre uno sconto del 50–90% su quella porzione. Non aiuta con la cronologia in crescita (che è sempre unica), ma riduce le spese generali fisse. A $ 0,0050 da un prompt di sistema da 1.000 token per chiamata, la memorizzazione nella cache consente di risparmiare circa $ 0,0045 per turno, un valore significativo per milioni di chiamate. Vedi il calcolatore rapido del risparmio di memorizzazione nella cache.
La maggior parte dei chatbot di produzione dovrebbe utilizzare una finestra mobile di 6-10 turni più un passaggio di compressione a una certa soglia. "Invia tutta la cronologia per sempre" è un'impostazione predefinita ragionevole per i prototipi. È un valore predefinito costoso per la produzione.
Inserisci i tuoi numeri nel calcolatore dei costi della cronologia delle conversazioni per vedere esattamente l'andamento dei costi tra i turni, confrontare i modelli e stimare i risparmi in termini di compressione. La differenza tra una cronologia di 30 turni e una finestra di 5 turni rappresenta spesso un costo inferiore del 60-70% per la stessa esperienza di prodotto.
Every API call re-sends the full conversation history as input tokens. Each turn adds the user message and assistant reply to everything that follows — so input size grows linearly with the number of turns.
The most practical fix is a rolling window: keep only the last 5–10 turns instead of all history. For assistants where context matters, periodic summarization lets you compress old turns into a short paragraph, keeping cost flat. Use the calcolatore dei costi della cronologia delle conversazioni to model the savings.
Solo per la parte statica (prompt di sistema, definizioni degli strumenti). La cronologia crescente è unica per conversazione, quindi non può essere memorizzata nella cache. La memorizzazione nella cache aiuta a ridurre il sovraccarico fisso, ovvero la parte variabile della cronologia per la quale paghi comunque.
Con GPT-4o a $ 5/$ 15 per 1 milione di token, un prompt di sistema da 1.000 token, turni utente da 150 token e risposte dell'assistente da 200 token: circa $ 1,02 in totale. Il primo turno costa $ 0,009, l'ultimo costa $ 0,060, quasi 7 volte in più.
Numeri di riferimento basati sui prezzi GPT-4o, giugno 2026: verifica le tariffe attuali sulla pagina dei prezzi del fornitore.