Los tokens de salida son la factura. Generation ejecuta un pase completo hacia adelante por token; prefill procesa todo el mensaje en paralelo por aproximadamente una décima parte de la energía por token. Una pregunta breve con una respuesta larga cuesta mucho más que una pregunta larga con una respuesta corta, y el rastro oculto de un modelo de razonamiento cuenta como resultado.
Misma carga de trabajo, cada clase de modelo
Volumen de solicitud y forma de token idénticos, enrutados a diferentes niveles. El salto al nivel de razonamiento no es incremental: es el mayor factor controlable en un presupuesto de carbono de inferencia.
| clase modelo | Wh / 1k tok de salida | kWh/mes | kg CO2e/mes | Costo de energía / mes |
|---|
Misma carga de trabajo, en todas las regiones
Computación idéntica, energía idéntica: solo cambia la red. Esta es la reducción de emisiones más barata disponible para cualquiera cuyo proveedor le permita elegir una región.
| Región | g CO2e/kWh | kg CO2e/mes | t CO2e/año | vs tu región |
|---|
Por qué la división entrada/salida es más importante que el total del token
Casi todos los intentos de estimar la energía de la IA multiplican el total de tokens por un único número por token, y eso es incorrecto en un sentido importante. La inferencia del transformador tiene dos fases con perfiles de costos completamente diferentes. Prefill lee todo el mensaje en una pasada muy paralela, por lo que un mensaje de 1500 tokens cuesta poco más que uno de 150 tokens en las pilas de servicio modernas. Decode genera un token a la vez, cada uno de los cuales requiere un paso completo sobre los pesos del modelo, por lo que la longitud de salida escala la energía de manera casi lineal. La consecuencia práctica es que incluir más contexto en un mensaje es comparativamente barato y dejar que un modelo divague es costoso: exactamente lo contrario de la intuición con la que comienzan la mayoría de los equipos, y lo opuesto a cómo se forma la hoja de precios, ya que los proveedores también cobran los insumos con un descuento, pero ni mucho menos 10x.
El nivel de razonamiento es donde las huellas van a morir.
Se genera el rastro de pensamiento de un modelo de razonamiento. Pasa por el decodificador exactamente como lo hace la respuesta visible, pero nunca llega al usuario. Una solicitud que produce 200 tokens visibles después de 2000 tokens de deliberación ha generado 2200 tokens, y si ese modelo también es un orden de magnitud mayor por token que la alternativa de nivel medio, la energía por solicitud puede ser cincuenta veces mayor que la misma tarea respondida directamente. Ejecute la tabla de clases de modelo anterior con su propio volumen y la aritmética es clara. Esta es también la palanca más manejable: enrutar solicitudes directas a un nivel más pequeño y reservar el razonamiento para los casos que lo necesitan reduce tanto la factura como el espacio a la vez. Tamaño que comercia con el calculadora de ahorro de enrutamiento modelo, y comprueba cuánto te están costando los tokens de pensamiento en dólares con el calculadora de costo de token de razonamiento.
La energía es un error de redondeo comparado con lo que pagas, y ese es el punto
Si se ejecutan los números predeterminados, la electricidad detrás de dos millones de solicitudes de nivel medio cuesta decenas de dólares frente a una factura API de miles. Nadie cambia de proveedor para salvar eso. La razón para calcularlo de todos modos es que la cifra de carbono, a diferencia del costo de la energía, termina en un CSRD o en un cuestionario para el cliente donde tiene que ser defendible, y cada vez más en conversaciones de adquisiciones donde se le pregunta a un proveedor por las emisiones por unidad de servicio. La fila de la región es sobre la que se debe actuar: un cálculo idéntico en una red con bajas emisiones de carbono emite una quinceava parte de lo que emite en una con mucho carbón, algo que ninguna optimización del modelo puede igualar. Si la obligación de divulgación en sí es lo que lo trajo aquí, valore el programa de gobernanza circundante con el Calculadora de costes de cumplimiento de la Ley de IA de la UE.