I token di output sono il conto. La generazione esegue un passaggio in avanti completo per token; prefill elabora l'intero prompt in parallelo per circa un decimo dell'energia per token. Un prompt breve con una risposta lunga costa molto di più di un prompt lungo con una risposta breve e la traccia nascosta di un modello di ragionamento conta come output.

kWh/mese
kg CO2e/mese
per richiesta
costo di compensazione/anno a 85 $/t

Stesso carico di lavoro, ogni classe di modello

Volume della richiesta e forma del token identici, instradati a livelli diversi. Il passaggio al livello di ragionamento non è incrementale: è il singolo fattore controllabile più grande in un bilancio di carbonio inferenziale.

Classe modelloWh / 1k di potenza in uscita tokkWh/mesekg CO2e/meseCosto energetico/mese

Stesso carico di lavoro, in ogni regione

Calcolo identico, energia identica: cambia solo la rete. Questa è la riduzione delle emissioni più economica disponibile per chiunque il cui fornitore gli consenta di scegliere una regione.

RegionegCO2e/kWhkg CO2e/mesetCO2e/annorispetto alla tua regione
⚠️ Stima modellata, non una misurazione. L'energia per token non è pubblicata da nessuno dei principali fornitori di API, quindi i valori delle classi qui sono valori di riferimento dell'ordine di grandezza coerenti con le divulgazioni degli operatori e la ricerca pubblica sull'energia di inferenza; il consumo reale varia in base alle dimensioni del batch, alla lunghezza della sequenza, alla quantizzazione, alla generazione e all'utilizzo dell'hardware. I token di input vengono addebitati al 10% della tariffa di output per riflettere la precompilazione parallela. Le intensità di rete sono fattori di generazione medi nazionali e ignorano strumenti basati sul mercato come PPA e REC, motivo per cui la cifra riportata da un operatore sarà solitamente inferiore a questa. Utilizzare per scala e confronto, non per divulgazione normativa. · Suggerisci un fattore migliore →

Perché la suddivisione input/output è più importante del totale dei token

Quasi ogni tentativo di stimare l’energia dell’IA moltiplica i token totali per un singolo numero per token, e questo è sbagliato in un modo che conta. L'inferenza del trasformatore ha due fasi con profili di costo completamente diversi. La precompilazione legge l'intero prompt in un passaggio fortemente parallelo, quindi un prompt da 1.500 token costa poco più di uno da 150 token sui moderni stack di servizio. La decodifica genera un token alla volta, ciascuno dei quali richiede un passaggio completo sui pesi del modello, quindi la lunghezza di output ridimensiona l'energia in modo quasi lineare. La conseguenza pratica è che inserire più contesto in un prompt è relativamente economico e lasciare che un modello divaghi è costoso: l'esatto opposto dell'intuizione con cui la maggior parte dei team inizia, e l'opposto di come è strutturato il foglio dei prezzi, dal momento che anche i fornitori addebitano l'input con uno sconto ma neanche lontanamente vicino a uno 10×.

Il livello del ragionamento è dove le impronte vanno a morire

Viene prodotta la traccia del pensiero di un modello di ragionamento. Attraversa il decodificatore esattamente come fa la risposta visibile, semplicemente non raggiunge mai l'utente. Una richiesta che produce 200 token visibili dopo 2.000 token di deliberazione ha generato 2.200 token e se quel modello è anche un ordine di grandezza più grande per token rispetto all'alternativa di livello intermedio, l'energia per richiesta può essere cinquanta volte superiore a quella a cui la stessa attività ha risposto direttamente. Esegui la tabella delle classi del modello sopra con il tuo volume e l'aritmetica è dura. Questa è anche la leva più trattabile: instradare le richieste semplici a un livello più piccolo e riservare il ragionamento ai casi che lo richiedono, riducendo contemporaneamente sia i costi che l'ingombro. Dimensioni che commerciano con calcolatore del risparmio di routing del modelloe controlla quanto ti costano in dollari i gettoni pensanti con calcolatore del costo del token di ragionamento.

L’energia è un errore di arrotondamento rispetto a ciò che paghi – e questo è il punto

Gestire i numeri predefiniti e l'elettricità dietro due milioni di richieste di livello intermedio costa decine di dollari a fronte di una fattura API di migliaia. Nessuno cambia fornitore per salvarlo. La ragione per calcolarlo comunque è che il numero di carbonio, a differenza del costo energetico, finisce in un CSRD o in un questionario del cliente dove deve essere difendibile, e sempre più spesso nelle conversazioni sugli appalti in cui a un fornitore vengono chieste le emissioni per unità di servizio. La riga della regione è quella su cui agire: un calcolo identico in una rete a basso contenuto di carbonio emette un quindicesimo di quello che fa in una ad alto consumo di carbone, che nessuna quantità di ottimizzazione del modello può eguagliare. Se l’obbligo di divulgazione in sé è ciò che ti ha portato qui, valuta il programma di governance circostante con il Calcolatore dei costi di conformità alla legge sull'intelligenza artificiale dell'UE.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Costo di conformità alla legge UE sull'intelligenza artificialeRisparmi relativi al routing del modelloCosto di inferenza GPULLM self-hosted e APILLM VRAM e concorrenza