Come funzionano i prezzi dell'API LLM

Token, input vs output, finestre di contesto: perché la stessa attività può costare 50 volte di più su un modello rispetto a un altro, spiegato in modo semplice.

CasaImparare › Come funzionano i prezzi dell'API LLM

Tutto ha un prezzo per gettone

I fornitori LLM non addebitano per richiesta o per parola: addebitano per gettone. Un token è un pezzo di testo, circa ¾ di una parola in inglese (circa 4 caratteri). "APICostCalc è utile" è di ~5 token. Sia il testo inviato (ingresso) e il testo generato dal modello (produzione) vengono conteggiati e solitamente viene loro assegnato un prezzo diversamente.

Calcolatore del costo dei gettoni →

Input vs output: l’output è quello costoso

Su quasi tutti i modelli, i token di output costano più dei token di input – spesso 3-5 volte di più – perché generare testo richiede un’elaborazione più intensiva che leggerlo. Questo è il motivo per cui un chatbot che scrive risposte lunghe costa molto di più di uno che classifica il testo in una singola parola, anche a parità di volume di richieste.

Determinante dei costiEffetto sulla bolletta
Il lungo messaggio di sistema ha inviato ogni chiamataI token di input si moltiplicano per il conteggio delle richieste
Risposte dettagliate del modelloToken di output: il tipo più costoso
Contesto ampio (pezzi RAG, cronologia)I token di input si gonfiano velocemente
Modelli di ragionamento/"pensiero".Token di ragionamento nascosti fatturati come output

La finestra di contesto è un limite di costo, non uno spazio libero

Quella di una modella finestra di contesto (ad esempio 128.000 o 1 milione di token) è il massimo che può leggere contemporaneamente, ma ogni token inserito viene fatturato ogni chiamata. Inserire un intero documento nel contesto di ogni richiesta è conveniente e costoso; questo è il problema che RAG e la memorizzazione nella cache risolvono.

Costo della finestra di contesto →Costo gettone ragionamento →

Perché la stessa attività varia 50 volte tra i modelli

I modelli di frontiera possono costare decine di dollari per milione di token; modelli piccoli o aperti pochi centesimi. Se un modello economico gestisce l'attività con una qualità accettabile, puoi ridurre i costi di un ordine di grandezza con una riga di config. L'abilità consiste nel far corrispondere la forza del modello alla difficoltà del compito: vedere guida al taglio dei costi.

Confronta i prezzi dei modelli →

Continua ad imparare

Come tagliare la fattura LLM →Token vs Richieste →Come scegliere un LLM →

Domande frequenti

Cos'è un token in un'API LLM?

Un token è una piccola porzione di testo elaborata dal modello: in inglese, circa ¾ di parola o circa 4 caratteri. I fornitori fatturano per token sia il testo inviato (input) sia il testo generato dal modello (output).

Perché i token di output costano più dei token di input?

La generazione di testo richiede più calcoli rispetto alla lettura, quindi i fornitori fissano prezzi più alti per i token di output, in genere 3-5 volte la velocità di input. Ciò rende le risposte dettagliate del modello un importante fattore di costo.

Una finestra di contesto più grande costa di più?

Solo per i token che effettivamente utilizzi. La finestra ha una capacità massima, ma ogni token inserito nel contesto viene fatturato per ogni chiamata, quindi l'invio ripetuto di prompt di grandi dimensioni diventa rapidamente costoso.

Come può la stessa attività costare 50 volte di più su un modello?

I prezzi dei modelli per milione di token variano enormemente tra i modelli di frontiera e quelli piccoli/aperti. Se un modello più economico soddisfa i tuoi standard di qualità per una determinata attività, passare ad esso può ridurre i costi di un ordine di grandezza.

Solo riferimento didattico: i prezzi sono stime; confermare le tariffe attuali sulla pagina dei prezzi di ciascun fornitore.