Ausgabe-Tokens sind die Rechnung. Die Generierung führt pro Token einen vollständigen Vorwärtsdurchlauf durch. prefill verarbeitet Ihren gesamten Prompt parallel für etwa ein Zehntel der Energie pro Token. Eine kurze Eingabeaufforderung mit einer langen Antwort kostet weitaus mehr als eine lange Eingabeaufforderung mit einer kurzen Antwort – und die verborgene Spur eines Argumentationsmodells zählt als Ausgabe.

kWh/Monat
kg CO2e / Monat
pro Anfrage
Ausgleichskosten/Jahr bei 85 $/t

Gleicher Arbeitsaufwand, jede Modellklasse

Identisches Anforderungsvolumen und identische Tokenform, weitergeleitet an verschiedene Ebenen. Der Sprung zur Argumentationsebene erfolgt nicht inkrementell – es handelt sich um den größten kontrollierbaren Einzelfaktor in einem Schlussfolgerungs-Kohlenstoffhaushalt.

ModellklasseWh / 1k AusgangsleistungkWh/Monatkg CO2e / MonatStromkosten/Monat

Gleicher Arbeitsaufwand, jede Region

Identische Rechenleistung, identische Energie – nur das Netz ändert sich. Dies ist die günstigste Emissionsreduzierung, die für jeden möglich ist, dessen Anbieter ihm die Wahl einer Region überlässt.

Regiong CO2e / kWhkg CO2e / Monatt CO2e / Jahrim Vergleich zu Ihrer Region
⚠️ Modellierte Schätzung, keine Messung. Die Energie pro Token wird von keinem großen API-Anbieter veröffentlicht, daher handelt es sich bei den Klassenzahlen hier um Referenzwerte in der Größenordnung, die mit den Offenlegungen der Betreiber und der öffentlichen Forschung zur Inferenzenergie übereinstimmen. Der tatsächliche Verbrauch variiert je nach Batch-Größe, Sequenzlänge, Quantisierung, Hardware-Generierung und -Nutzung. Eingabetokens werden mit 10 % der Ausgaberate berechnet, um die parallele Vorfüllung widerzuspiegeln. Netzintensitäten sind nationale durchschnittliche Erzeugungsfaktoren und ignorieren marktbasierte Instrumente wie PPAs und RECs, weshalb die vom Betreiber selbst gemeldeten Werte in der Regel niedriger ausfallen. Verwendung für Skalierungs- und Vergleichszwecke, nicht für behördliche Offenlegung. · Schlagen Sie einen besseren Faktor vor →

Warum die Input/Output-Aufteilung wichtiger ist als die Token-Gesamtzahl

Fast jeder Versuch, die KI-Energie abzuschätzen, multipliziert die Gesamtzahl der Token mit einer einzigen Zahl pro Token, und das ist in einer wichtigen Hinsicht falsch. Die Transformatorinferenz besteht aus zwei Phasen mit völlig unterschiedlichen Kostenprofilen. Prefill liest Ihre gesamte Eingabeaufforderung in einem stark parallelen Durchgang, sodass eine Eingabeaufforderung mit 1.500 Token kaum mehr kostet als eine Eingabeaufforderung mit 150 Token auf modernen Servierstapeln. Durch die Dekodierung wird jeweils ein Token generiert, wobei jeweils ein vollständiger Durchlauf der Modellgewichte erforderlich ist, sodass die Ausgabelänge die Energie nahezu linear skaliert. Die praktische Konsequenz besteht darin, dass es vergleichsweise günstig ist, mehr Kontext in eine Eingabeaufforderung zu stopfen, und es teuer ist, ein Modell herumschweifen zu lassen – das genaue Gegenteil der Intuition, mit der die meisten Teams beginnen, und das Gegenteil der Gestaltung des Preisblatts, da Anbieter Eingaben ebenfalls mit einem Rabatt berechnen, aber nicht annähernd mit dem 10-fachen.

Auf der Argumentationsebene sterben Fußabdrücke

Die Denkspur eines Argumentationsmodells wird ausgegeben. Es durchläuft den Decoder genau wie die sichtbare Antwort, erreicht den Benutzer jedoch nie. Eine Anfrage, die nach 2.000 Überlegungstoken 200 sichtbare Token erzeugt, hat 2.200 Token generiert, und wenn dieses Modell auch pro Token um eine Größenordnung größer ist als die mittelstufige Alternative, kann die Energie pro Anfrage fünfzigmal höher sein als bei der direkten Beantwortung derselben Aufgabe. Führen Sie die obige Modellklassentabelle mit Ihrem eigenen Volumen aus, und die Arithmetik ist eindeutig. Dies ist auch der am besten handhabbare Hebel: Durch die Weiterleitung unkomplizierter Anfragen an eine kleinere Ebene und die Zurückbehaltung der Begründung für die Fälle, in denen sie erforderlich ist, werden sowohl die Rechnung als auch der Platzbedarf reduziert. Größe, die mit dem handelt Sparrechner für Modellrouten, und prüfen Sie mit dem, was Sie die Denkmarken in Dollar kosten Argumentations-Token-Kostenrechner.

Energie ist ein Rundungsfehler bei dem, was Sie bezahlen – und das ist der Punkt

Führen Sie die Standardzahlen aus, und der Strom hinter zwei Millionen Anfragen mittlerer Ebene kostet Dutzende von Dollar im Vergleich zu einer API-Rechnung in Tausenden. Niemand wechselt den Anbieter, um das zu retten. Der Grund, sie trotzdem zu berechnen, liegt darin, dass die Kohlenstoffzahl im Gegensatz zu den Energiekosten in einer CSRD- oder Kundenfragebogenoffenlegung landet, wo sie vertretbar sein muss, und zunehmend auch in Beschaffungsgesprächen, in denen ein Lieferant nach den Emissionen pro Dienstleistungseinheit gefragt wird. Die Regionszeile ist diejenige, auf die reagiert werden muss: Identische Rechenleistung in einem kohlenstoffarmen Netz emittiert ein Fünfzehntel dessen, was sie in einem kohlelastigen Netz verursacht, was mit keiner noch so großen Modelloptimierung erreicht werden kann. Wenn die Offenlegungspflicht selbst Sie hierher geführt hat, bewerten Sie das umgebende Governance-Programm mit Kostenrechner für die Einhaltung des EU-KI-Gesetzes.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Kosten für die Einhaltung des EU-KI-GesetzesEinsparungen beim ModellroutingGPU-InferenzkostenSelbstgehostetes LLM vs. APILLM VRAM und Parallelität