I token di output sono il conto. La generazione esegue un passaggio in avanti completo per token; prefill elabora l'intero prompt in parallelo per circa un decimo dell'energia per token. Un prompt breve con una risposta lunga costa molto di più di un prompt lungo con una risposta breve e la traccia nascosta di un modello di ragionamento conta come output.
Stesso carico di lavoro, ogni classe di modello
Volume della richiesta e forma del token identici, instradati a livelli diversi. Il passaggio al livello di ragionamento non è incrementale: è il singolo fattore controllabile più grande in un bilancio di carbonio inferenziale.
| Classe modello | Wh / 1k di potenza in uscita tok | kWh/mese | kg CO2e/mese | Costo energetico/mese |
|---|
Stesso carico di lavoro, in ogni regione
Calcolo identico, energia identica: cambia solo la rete. Questa è la riduzione delle emissioni più economica disponibile per chiunque il cui fornitore gli consenta di scegliere una regione.
| Regione | gCO2e/kWh | kg CO2e/mese | tCO2e/anno | rispetto alla tua regione |
|---|
Perché la suddivisione input/output è più importante del totale dei token
Quasi ogni tentativo di stimare l’energia dell’IA moltiplica i token totali per un singolo numero per token, e questo è sbagliato in un modo che conta. L'inferenza del trasformatore ha due fasi con profili di costo completamente diversi. La precompilazione legge l'intero prompt in un passaggio fortemente parallelo, quindi un prompt da 1.500 token costa poco più di uno da 150 token sui moderni stack di servizio. La decodifica genera un token alla volta, ciascuno dei quali richiede un passaggio completo sui pesi del modello, quindi la lunghezza di output ridimensiona l'energia in modo quasi lineare. La conseguenza pratica è che inserire più contesto in un prompt è relativamente economico e lasciare che un modello divaghi è costoso: l'esatto opposto dell'intuizione con cui la maggior parte dei team inizia, e l'opposto di come è strutturato il foglio dei prezzi, dal momento che anche i fornitori addebitano l'input con uno sconto ma neanche lontanamente vicino a uno 10×.
Il livello del ragionamento è dove le impronte vanno a morire
Viene prodotta la traccia del pensiero di un modello di ragionamento. Attraversa il decodificatore esattamente come fa la risposta visibile, semplicemente non raggiunge mai l'utente. Una richiesta che produce 200 token visibili dopo 2.000 token di deliberazione ha generato 2.200 token e se quel modello è anche un ordine di grandezza più grande per token rispetto all'alternativa di livello intermedio, l'energia per richiesta può essere cinquanta volte superiore a quella a cui la stessa attività ha risposto direttamente. Esegui la tabella delle classi del modello sopra con il tuo volume e l'aritmetica è dura. Questa è anche la leva più gestibile: instradare le richieste semplici a un livello più piccolo e riservare il ragionamento ai casi che lo richiedono, riducendo contemporaneamente sia i costi che l'ingombro. Dimensioni che commerciano con calcolatore del risparmio di routing del modelloe controlla quanto ti costano in dollari i gettoni pensanti con calcolatore del costo del token di ragionamento.
L’energia è un errore di arrotondamento rispetto a ciò che paghi – e questo è il punto
Gestire i numeri predefiniti e l'elettricità dietro due milioni di richieste di livello intermedio costa decine di dollari a fronte di una fattura API di migliaia. Nessuno cambia fornitore per salvarlo. La ragione per calcolarlo comunque è che il numero di carbonio, a differenza del costo energetico, finisce in un CSRD o in un questionario del cliente dove deve essere difendibile, e sempre più spesso nelle conversazioni sugli appalti in cui a un fornitore vengono chieste le emissioni per unità di servizio. La riga della regione è quella su cui agire: un calcolo identico in una rete a basso contenuto di carbonio emette un quindicesimo di quello che fa in una ad alto consumo di carbone, che nessuna quantità di ottimizzazione del modello può eguagliare. Se l’obbligo di divulgazione in sé è ciò che ti ha portato qui, valuta il programma di governance circostante con il Calcolatore dei costi di conformità alla legge sull'intelligenza artificiale dell'UE.