Los tokens de salida son la factura. Generation ejecuta un pase completo hacia adelante por token; prefill procesa todo el mensaje en paralelo por aproximadamente una décima parte de la energía por token. Una pregunta breve con una respuesta larga cuesta mucho más que una pregunta larga con una respuesta corta, y el rastro oculto de un modelo de razonamiento cuenta como resultado.
—kg CO2e/mes
—por solicitud
—costo de compensación / año @ $85/t
Misma carga de trabajo, cada clase de modelo
Volumen de solicitud y forma de token idénticos, enrutados a diferentes niveles. El salto al nivel de razonamiento no es incremental: es el mayor factor controlable en un presupuesto de carbono de inferencia.
| clase modelo | Wh / 1k tok de salida | kWh/mes | kg CO2e/mes | Costo de energía / mes |
|---|
Misma carga de trabajo, en todas las regiones
Computación idéntica, energía idéntica: solo cambia la red. Esta es la reducción de emisiones más barata disponible para cualquiera cuyo proveedor le permita elegir una región.
| Región | g CO2e/kWh | kg CO2e/mes | t CO2e/año | vs tu región |
|---|
⚠️ Estimación modelada, no una medición. Ningún proveedor importante de API publica la energía por token, por lo que las cifras de clase aquí son valores de referencia de orden de magnitud consistentes con las divulgaciones de los operadores y la investigación pública sobre la energía de inferencia; El consumo real varía según el tamaño del lote, la longitud de la secuencia, la cuantificación, la generación y utilización del hardware. Los tokens de entrada se cobran al 10 % de la tasa de salida para reflejar el precarga paralela. Las intensidades de la red son factores de generación promedio nacional e ignoran los instrumentos basados en el mercado, como los PPA y los REC, por lo que la cifra reportada por el propio operador generalmente será más baja. Úselo para escala y comparación, no para divulgación regulatoria. ·
Sugerir un factor mejor →
Por qué la división entrada/salida es más importante que el total del token
Casi todos los intentos de estimar la energía de la IA multiplican el total de tokens por un único número por token, y eso es incorrecto en un sentido importante. La inferencia del transformador tiene dos fases con perfiles de costos completamente diferentes. Prefill lee todo el mensaje en una pasada muy paralela, por lo que un mensaje de 1500 tokens cuesta poco más que uno de 150 tokens en las pilas de servicio modernas. Decode genera un token a la vez, cada uno de los cuales requiere un paso completo sobre los pesos del modelo, por lo que la longitud de salida escala la energía de manera casi lineal. La consecuencia práctica es que incluir más contexto en un mensaje es comparativamente barato y dejar que un modelo divague es costoso: exactamente lo contrario de la intuición con la que comienzan la mayoría de los equipos, y lo opuesto a cómo se forma la hoja de precios, ya que los proveedores también cobran los insumos con un descuento, pero ni mucho menos 10x.
El nivel de razonamiento es donde las huellas van a morir.
Se genera el rastro de pensamiento de un modelo de razonamiento. Pasa por el decodificador exactamente como lo hace la respuesta visible, pero nunca llega al usuario. Una solicitud que produce 200 tokens visibles después de 2000 tokens de deliberación ha generado 2200 tokens, y si ese modelo también es un orden de magnitud mayor por token que la alternativa de nivel medio, la energía por solicitud puede ser cincuenta veces mayor que la misma tarea respondida directamente. Ejecute la tabla de clases de modelo anterior con su propio volumen y la aritmética es clara. Esta es también la palanca más manejable: enrutar solicitudes directas a un nivel más pequeño y reservar el razonamiento para los casos que lo necesitan reduce tanto la factura como el espacio a la vez. Tamaño que comercia con el calculadora de ahorro de enrutamiento modelo, y comprueba cuánto te están costando los tokens de pensamiento en dólares con el calculadora de costo de token de razonamiento.
La energía es un error de redondeo comparado con lo que pagas, y ese es el punto
Si se ejecutan los números predeterminados, la electricidad detrás de dos millones de solicitudes de nivel medio cuesta decenas de dólares frente a una factura API de miles. Nadie cambia de proveedor para salvar eso. La razón para calcularlo de todos modos es que la cifra de carbono, a diferencia del costo de la energía, termina en un CSRD o en un cuestionario para el cliente donde tiene que ser defendible, y cada vez más en conversaciones de adquisiciones donde se le pregunta a un proveedor por las emisiones por unidad de servicio. La fila de la región es sobre la que se debe actuar: un cálculo idéntico en una red con bajas emisiones de carbono emite una quinceava parte de lo que emite en una con mucho carbón, algo que ninguna optimización del modelo puede igualar. Si la obligación de divulgación en sí es lo que lo trajo aquí, valore el programa de gobernanza circundante con el Calculadora de costes de cumplimiento de la Ley de IA de la UE.
Costo de cumplimiento de la Ley de IA de la UEAhorros en rutas de modelosCosto de inferencia de GPULLM autohospedado frente a APILLM VRAM y concurrencia
Cómo funciona esta calculadora
Esta calculadora estima la huella energética y de carbono de su carga de trabajo de inferencia de IA en lugar de la factura de API en sí. Usted ingresa sus solicitudes por mes, clase de modelo y los tokens de entrada y salida por solicitud para establecer el volumen total de tokens mensual, que se convierte en kilovatios-hora consumidos y kilogramos de CO2e emitidos. Los principales impulsores son la clase del modelo (los modelos más grandes consumen más energía por token), el volumen de salida (el razonamiento y las respuestas largas multiplican la huella), el región del centro de datos y su intensidad de carbono en la red, y la PUE, que representa la refrigeración y los gastos generales más allá de los chips. La tarifa de electricidad industrial le permite fijar el precio de la energía subyacente y su factura mensual proporciona un punto de referencia para comparar.
La compensación que vale la pena observar es tokens de salida versus región: un modelo hablador o un razonamiento pesado pueden dominar el uso de energía, por lo que recortar la producción innecesaria a menudo recorta más que cualquier cambio de infraestructura. Al mismo tiempo, la misma carga de trabajo se ejecuta en un región baja en carbono puede emitir una fracción del CO2e de una red con alto contenido de carbón, incluso con kWh idénticos. Trate los números como estimaciones direccionales, ya que el PUE real, la combinación de la red y la energía por token varían según el proveedor y la hora, y utilícelos para comparar opciones en lugar de medidas exactas.
Preguntas frecuentes
¿Cuánta energía utiliza una llamada API de LLM?
Para un modelo de tamaño mediano que produce unos pocos cientos de tokens de salida, las estimaciones publicadas por los operadores sitúan una sola solicitud corta en la región de unas pocas décimas de vatio-hora, aproximadamente lo que consume una computadora portátil en veinte segundos. El número está dominado por los tokens de salida, porque la generación ejecuta todo el modelo una vez por token, mientras que el prefill procesa la entrada en paralelo a una pequeña fracción del costo por token. Es por eso que esta calculadora valora los tokens de entrada a aproximadamente una décima parte de la tasa de salida, y por qué una pregunta larga con una respuesta corta es mucho más barata en energía que una pregunta corta con una respuesta larga.
¿Por qué los modelos de razonamiento tienen una huella de carbono tan grande?
Porque se genera el rastro de razonamiento oculto. Un modelo de razonamiento que piensa con dos mil tokens antes de escribir una respuesta de doscientos tokens ha generado 2200 tokens de salida, no 200, y cada uno de ellos cuesta un pase completo hacia adelante a través de un modelo grande. Cambiar una carga de trabajo de un modelo de tamaño mediano a un modelo de cadena de pensamiento larga con el mismo volumen de solicitudes generalmente multiplica la energía en un orden de magnitud, lo cual es visible inmediatamente en la tabla de comparación de clases de modelos en esta página. También es la razón por la que la reducción de carbono más barata disponible para la mayoría de los equipos es desviar las solicitudes fáciles del nivel de razonamiento en lugar de cambiar algo relacionado con la infraestructura.
¿La región del centro de datos realmente cambia mi huella de carbono de la IA?
Más que cualquier otra palanca única. La intensidad de carbono de la red abarca aproximadamente 40 gramos de CO2e por kilovatio-hora en redes con uso pesado de energía nuclear e hidroeléctrica, como Francia y Suecia, hasta más de 600 gramos en redes con uso pesado de carbón, un factor de quince para cálculos idénticos. Ejecutar la misma carga de trabajo en una región con bajas emisiones de carbono reduce las emisiones en más del 90% sin tocar una línea de código, mientras que el trabajo de eficiencia en el modelo en sí rara vez ofrece más de un factor de dos o tres. El PUE también importa, pero tiene una distribución mucho más estrecha, ya que los sitios modernos de hiperescala se agrupan entre 1.1 y 1.2, mientras que las salas empresariales más antiguas se ubican más cerca de 1.6.