Cos'è un token? (E perché ti viene fatturato)
Ogni volta che chiami un modello AI, non ti viene addebitata la parola, il personaggio o la richiesta. La fatturazione viene effettuata in base al token. Capire cos'è effettivamente un token è la cosa più utile che puoi imparare prima di provare a controllare i costi dell'API.
Un token è una porzione di testo, non una parola
Un token è l'unità che un modello linguistico legge e scrive. Di solito è un frammento di una parola piuttosto che una parola intera. Parole brevi comuni come the O and sono un unico token, ma le parole più lunghe o più rare vengono divise in più parti. Ad esempio, la parola tokenization potrebbe essere violato token + ization, two tokens.
Una regola approssimativa ampiamente utilizzata per l’inglese è questa 1 token contiene circa 4 caratteri o circa 0,75 parole. Ciò significa che 1.000 token equivalgono a circa 750 parole e una singola pagina di testo (circa 500 parole) equivale a circa 650-700 token. Si tratta di approssimazioni, non di garanzie, poiché la suddivisione esatta dipende dal tokenizzatore del modello.
Contano anche gli spazi, la punteggiatura e le interruzioni di riga. Anche la struttura invisibile del tuo prompt consuma token.
Perché i modelli utilizzano token invece di parole
I modelli linguistici non comprendono direttamente le lettere o le parole. Convertono il testo in numeri e il token è il ponte. Ogni segnalino corrisponde a una voce nel vocabolario del modello e il modello esegue tutti i calcoli su quei pezzi numerati.
Questo design consente a un modello di gestire qualsiasi lingua, codice, emoji o parola inventata senza un dizionario fisso di parole complete. Un raro termine tecnico che il modello non ha mai visto nel suo insieme può ancora essere rappresentato come una sequenza di sottopezzi familiari. Il compromesso è che testi, codici o lingue non inglesi insoliti spesso utilizzano più token per parola rispetto alla semplice prosa inglese.
I token di input e i token di output hanno un prezzo diverso
Quasi ogni fornitore applica due tariffe separate: una per gettoni di input (tutto ciò che invii, incluso il messaggio, le istruzioni di sistema e l'eventuale cronologia delle conversazioni) e uno per gettoni di uscita (tutto ciò che il modello genera indietro). I token di output sono in genere molte volte più costosi dei token di input.
Ecco un esempio illustrativo per mostrare il meccanismo (numeri inventati per chiarezza, non prezzi reali): se l'input costa $ 1 per milione di token e l'output costa $ 5 per milione di token, allora una chiamata che invia 2.000 token di input e riceve 500 token di output costerebbe (2.000 / 1.000.000 x $ 1) + (500 / 1.000.000 x $ 5) = $ 0,002 + $ 0,0025 = $ 0,0045. Piccolo per chiamata, ma moltiplicato per centinaia di migliaia di chiamate e conta.
Per vedere le tariffe reali per modello fianco a fianco, il confronto dei modelli e le pagine /models elencano i prezzi attuali di input e output per ciascun fornitore in modo da non tirare a indovinare.
La cronologia delle conversazioni viene fatturata a ogni turno
La sorpresa più comune in termini di fatturazione è che i modelli di chat sono stateless. La modella non ricorda i tuoi messaggi precedenti tra una chiamata e l'altra. Per mantenere il contesto, l'applicazione invia nuovamente l'intera cronologia delle conversazioni a ogni nuovo turno.
Ciò significa che una lunga chat diventa più costosa con ogni messaggio, perché la trascrizione in crescita viene inviata nuovamente come token di input ogni volta. Una conversazione di 20 messaggi può inviare tranquillamente decine di migliaia di token di input nel suo turno finale. Se i costi aumentano durante le sessioni lunghe, di solito è questo il motivo. La memorizzazione immediata nella cache (trattata nella propria guida) è un modo per attenuare questo problema.
Come stimare la bolletta prima di costruire
Puoi ottenere una stima praticabile con tre numeri: token di input medi per chiamata, token di output medi per chiamata e quante chiamate ti aspetti al giorno o al mese. Moltiplicare ciascun conteggio di token per la sua tariffa per token e sommarli insieme.
- Stima dei conteggi dei token prendendo un esempio di prompt e risposta realistici, quindi dividendo il conteggio dei caratteri per 4 oppure utilizzando uno strumento tokenizzatore per maggiore precisione.
- Moltiplicare per il volume per ottenere una cifra giornaliera o mensile.
- Aggiungi un buffer del 20-30% per tentativi, risultati più lunghi del previsto e cronologia chat in crescita.
Il calcolatore dei costi LLM fa questi calcoli per te: collega i conteggi dei token e il volume delle chiamate, scegli un modello e restituisce un costo mensile stimato in modo da poter confrontare le opzioni prima di scrivere qualsiasi codice.
Modi pratici per utilizzare meno token
Una volta che si pensa in termini di gettoni, il risparmio diventa ovvio. Il sistema Trim richiede che ripetono le stesse istruzioni alla lettera su ogni chiamata. Riassumi i vecchi turni di conversazione invece di inviarli nuovamente per intero. Richiedi un output conciso quando non hai bisogno di risposte lunghe, poiché i token di output costano di più.
Scegliere un modello più piccolo per compiti semplici è spesso la leva più importante di tutte, perché la differenza di prezzo per token tra un modello di punta e un modello leggero può essere 10 volte o più. Adatta il modello alla difficoltà del lavoro piuttosto che scegliere quello più potente.
Continua ad imparare
Strumenti correlati
Domande frequenti
Quanti token è una frase tipica?
Una breve frase inglese di 15-20 parole equivale solitamente a circa 20-30 token. Come regola generale, aspettati circa 0,75 parole per token, quindi il conteggio dei token è leggermente superiore al conteggio delle parole.
Pago per i token nella risposta del modello?
SÌ. I token di output vengono fatturati separatamente dai token di input e di solito sono i più costosi dei due, quindi le risposte più lunghe costano notevolmente di più.
Perché i testi non in inglese costano di più?
La maggior parte dei tokenizzatori sono ottimizzati per l'inglese, quindi altre lingue e codici spesso vengono suddivisi in più token per parola. Lo stesso significato può costare 1,5-2 volte più token in alcune lingue.
Solo formazione, non consulenza finanziaria.