Ausgabe-Tokens sind die Rechnung. Die Generierung führt pro Token einen vollständigen Vorwärtsdurchlauf durch. prefill verarbeitet Ihren gesamten Prompt parallel für etwa ein Zehntel der Energie pro Token. Eine kurze Eingabeaufforderung mit einer langen Antwort kostet weitaus mehr als eine lange Eingabeaufforderung mit einer kurzen Antwort – und die verborgene Spur eines Argumentationsmodells zählt als Ausgabe.
Gleicher Arbeitsaufwand, jede Modellklasse
Identisches Anforderungsvolumen und identische Tokenform, weitergeleitet an verschiedene Ebenen. Der Sprung zur Argumentationsebene erfolgt nicht inkrementell – es handelt sich um den größten kontrollierbaren Einzelfaktor in einem Schlussfolgerungs-Kohlenstoffhaushalt.
| Modellklasse | Wh / 1k Ausgangsleistung | kWh/Monat | kg CO2e / Monat | Stromkosten/Monat |
|---|
Gleicher Arbeitsaufwand, jede Region
Identische Rechenleistung, identische Energie – nur das Netz ändert sich. Dies ist die günstigste Emissionsreduzierung, die für jeden möglich ist, dessen Anbieter ihm die Wahl einer Region überlässt.
| Region | g CO2e / kWh | kg CO2e / Monat | t CO2e / Jahr | im Vergleich zu Ihrer Region |
|---|
Warum die Input/Output-Aufteilung wichtiger ist als die Token-Gesamtzahl
Fast jeder Versuch, die KI-Energie abzuschätzen, multipliziert die Gesamtzahl der Token mit einer einzigen Zahl pro Token, und das ist in einer wichtigen Hinsicht falsch. Die Transformatorinferenz besteht aus zwei Phasen mit völlig unterschiedlichen Kostenprofilen. Prefill liest Ihre gesamte Eingabeaufforderung in einem stark parallelen Durchgang, sodass eine Eingabeaufforderung mit 1.500 Token kaum mehr kostet als eine Eingabeaufforderung mit 150 Token auf modernen Servierstapeln. Durch die Dekodierung wird jeweils ein Token generiert, wobei jeweils ein vollständiger Durchlauf der Modellgewichte erforderlich ist, sodass die Ausgabelänge die Energie nahezu linear skaliert. Die praktische Konsequenz besteht darin, dass es vergleichsweise günstig ist, mehr Kontext in eine Eingabeaufforderung zu stopfen, und es teuer ist, ein Modell herumschweifen zu lassen – das genaue Gegenteil der Intuition, mit der die meisten Teams beginnen, und das Gegenteil der Gestaltung des Preisblatts, da Anbieter Eingaben ebenfalls mit einem Rabatt berechnen, aber nicht annähernd mit dem 10-fachen.
Auf der Argumentationsebene sterben Fußabdrücke
Die Denkspur eines Argumentationsmodells wird ausgegeben. Es durchläuft den Decoder genau wie die sichtbare Antwort, erreicht den Benutzer jedoch nie. Eine Anfrage, die nach 2.000 Überlegungstoken 200 sichtbare Token erzeugt, hat 2.200 Token generiert, und wenn dieses Modell auch pro Token um eine Größenordnung größer ist als die mittelstufige Alternative, kann die Energie pro Anfrage fünfzigmal höher sein als bei der direkten Beantwortung derselben Aufgabe. Führen Sie die obige Modellklassentabelle mit Ihrem eigenen Volumen aus, und die Arithmetik ist eindeutig. Dies ist auch der am besten handhabbare Hebel: Durch die Weiterleitung unkomplizierter Anfragen an eine kleinere Ebene und die Zurückbehaltung der Begründung für die Fälle, in denen sie erforderlich ist, werden sowohl die Rechnung als auch der Platzbedarf reduziert. Größe, die mit dem handelt Sparrechner für Modellrouten, und prüfen Sie mit dem, was Sie die Denkmarken in Dollar kosten Argumentations-Token-Kostenrechner.
Energie ist ein Rundungsfehler bei dem, was Sie bezahlen – und das ist der Punkt
Führen Sie die Standardzahlen aus, und der Strom hinter zwei Millionen Anfragen mittlerer Ebene kostet Dutzende von Dollar im Vergleich zu einer API-Rechnung in Tausenden. Niemand wechselt den Anbieter, um das zu retten. Der Grund, sie trotzdem zu berechnen, liegt darin, dass die Kohlenstoffzahl im Gegensatz zu den Energiekosten in einer CSRD- oder Kundenfragebogenoffenlegung landet, wo sie vertretbar sein muss, und zunehmend auch in Beschaffungsgesprächen, in denen ein Lieferant nach den Emissionen pro Dienstleistungseinheit gefragt wird. Die Regionszeile ist diejenige, auf die reagiert werden muss: Identische Rechenleistung in einem kohlenstoffarmen Netz emittiert ein Fünfzehntel dessen, was sie in einem kohlelastigen Netz verursacht, was mit keiner noch so großen Modelloptimierung erreicht werden kann. Wenn die Offenlegungspflicht selbst Sie hierher geführt hat, bewerten Sie das umgebende Governance-Programm mit Kostenrechner für die Einhaltung des EU-KI-Gesetzes.