Le finestre di contesto e perché i prompt lunghi diventano costosi
La finestra di contesto è la quantità massima di testo che un modello può considerare contemporaneamente ed è una delle parti più fraintese dei prezzi dell'IA. Una grande finestra sembra una funzionalità gratuita, ma ogni token inserito al suo interno viene fatturato ad ogni chiamata. Questa guida spiega come funziona la finestra e perché i messaggi lunghi gonfiano silenziosamente la bolletta.
Cos'è una finestra di contesto
La finestra di contesto è la memoria di lavoro del modello per una singola richiesta, misurata in token. Deve contenere tutto ciò che il modello considera in una volta: il prompt del sistema, eventuali documenti o esempi inclusi, la cronologia delle conversazioni, la domanda corrente e lo spazio riservato alla risposta del modello. Insieme, questi devono rientrare nel limite dei token della finestra.
I modelli pubblicizzano finestre di varie dimensioni, da poche migliaia di token a centinaia di migliaia o più. Una finestra più grande ti consente di inserire più contenuti contemporaneamente, un intero libro, una grande codebase, ma non cambia la regola fondamentale di fatturazione: paghi per quello che inserisci.
Paghi per l'intero sportello utilizzato, per ogni chiamata
Ecco la parte che cattura le persone. Avere una finestra da 200.000 token non significa pagare per 200.000 token. Significa te Potere utilizzane fino a quel numero e ti verranno addebitati tutti i numeri effettivamente inclusi in ogni singola chiamata.
Quindi, se inserisci 150.000 token di documenti nella finestra e fai 10 domande, pagherai circa 150.000 token di input dieci volte, 1,5 milioni di token, non una volta. La finestra è un tetto, non un abbonamento. Il contesto lungo è potente, ma viene fatturato incessantemente per chiamata.
Perché i prompt lunghi diventano costosi velocemente
Poiché i token di input vengono fatturati per chiamata, la lunghezza della richiesta si moltiplica con il volume delle chiamate. Un prompt 10 volte più lungo costa circa 10 volte di più in token di input per lo stesso numero di chiamate. Due abitudini spingono a lungo i suggerimenti senza che le persone se ne accorgano:
- Cronologia chat in crescita, si risentono completamente ad ogni turno, quindi i messaggi tardivi in una lunga conversazione portano l'intera trascrizione.
- Recupero (RAG), in cui si incollano documenti recuperati di grandi dimensioni nel prompt per fornire il contesto del modello. Recupera troppo e ogni query ti ripaga tutto.
Nessuno dei due ha torto, ma entrambi necessitano di disciplina, perché il costo tace finché non arriva la fattura.
Un'illustrazione realizzata
Esempio illustrativo (tasso inventato di $ 3 per milione di token di input). Supponiamo che ogni query includa un contesto recuperato di 50.000 token. Una query costa 50.000/1.000.000 x $ 3 = $ 0,15 solo in input. Esegui 100.000 query di questo tipo al mese, ovvero $ 15.000 solo per il contesto che stai reinviando, prima dei costi di output.
Ora riduci il contesto recuperato a 10.000 token recuperando in modo più selettivo. Le stesse 100.000 query costano $ 3.000, un quinto di più, per un contesto che spesso è altrettanto utile perché il modello stava comunque annegando nei 40.000 token extra. Questo è il motivo per cui la disciplina del contesto è uno dei controlli sui costi con la leva più alta di cui disponi.
Anche un contesto lungo può danneggiare la qualità
Più contesto non significa sempre risposte migliori. I modelli possono perdere traccia dei dettagli sepolti nel mezzo di un prompt molto lungo, uno schema in cui le informazioni all'inizio e alla fine vengono utilizzate bene ma la parte centrale viene trascurata. Quindi una finestra di contesto gonfia può costare di più E produrre risultati peggiori.
Fornire al modello solo il materiale più rilevante spesso migliora sia il conto che la risposta. La precisione batte il volume: un contesto ristretto e ben scelto di 4.000 token spesso supera un vasto dump di 100.000 token.
Come mantenere il contesto snello
Tattiche pratiche per controllare il costo del contesto:
- Recuperare in modo selettivo. In RAG, restituisci solo i primi blocchi più rilevanti, non tutto ciò che corrisponde vagamente.
- Riassumi i vecchi turni. Sostituisci la conversazione passata da tempo con un breve riepilogo invece di inviare nuovamente la trascrizione completa.
- Memorizza nella cache la parte fissa. Se una grande porzione di contesto si ripete tra le chiamate, la memorizzazione nella cache del prompt (vedi quella guida) può ridurre drasticamente il costo del reinvio.
- Ridimensiona correttamente la finestra. Scegli un modello la cui finestra corrisponda alle tue reali esigenze piuttosto che optare per la più grande disponibile.
Per vedere come la lunghezza immediata corrisponde al denaro reale per ciascun modello, inserisci i conteggi dei token nel calcolatore dei costi LLM e controlla i prezzi delle finestre per modello nelle pagine di confronto dei modelli e /modelli.
Continua ad imparare
Strumenti correlati
Domande frequenti
Pago per la finestra di contesto completa del modello?
No. Paghi solo i token effettivamente inclusi in ogni richiesta, fino al limite della finestra. La finestra ha una capacità massima e ogni token utilizzato al suo interno viene fatturato ad ogni chiamata.
Una finestra di contesto più grande costa di più per token?
Non necessariamente per token, ma una finestra più grande ti induce a includere molto più testo e, poiché ogni token viene fatturato per chiamata, i prompt più grandi aumentano il totale. Alcuni fornitori applicano anche tariffe più elevate al di sopra di determinate lunghezze del contesto.
Più contesto è sempre migliore per la qualità?
No. I modelli possono trascurare i dettagli nascosti in istruzioni molto lunghe, quindi un contesto eccessivo può sia aumentare i costi che ridurre la qualità delle risposte. Un contesto più piccolo e ben scelto spesso offre risultati migliori.
Solo formazione, non consulenza finanziaria.