Los tokens de salida son la factura. Generation ejecuta un pase completo hacia adelante por token; prefill procesa todo el mensaje en paralelo por aproximadamente una décima parte de la energía por token. Una pregunta breve con una respuesta larga cuesta mucho más que una pregunta larga con una respuesta corta, y el rastro oculto de un modelo de razonamiento cuenta como resultado.

kWh/mes
kg CO2e/mes
por solicitud
costo de compensación / año @ $85/t

Misma carga de trabajo, cada clase de modelo

Volumen de solicitud y forma de token idénticos, enrutados a diferentes niveles. El salto al nivel de razonamiento no es incremental: es el mayor factor controlable en un presupuesto de carbono de inferencia.

clase modeloWh / 1k tok de salidakWh/meskg CO2e/mesCosto de energía / mes

Misma carga de trabajo, en todas las regiones

Computación idéntica, energía idéntica: solo cambia la red. Esta es la reducción de emisiones más barata disponible para cualquiera cuyo proveedor le permita elegir una región.

Regióng CO2e/kWhkg CO2e/mest CO2e/añovs tu región
⚠️ Estimación modelada, no una medición. Ningún proveedor importante de API publica la energía por token, por lo que las cifras de clase aquí son valores de referencia de orden de magnitud consistentes con las divulgaciones de los operadores y la investigación pública sobre la energía de inferencia; El consumo real varía según el tamaño del lote, la longitud de la secuencia, la cuantificación, la generación y utilización del hardware. Los tokens de entrada se cobran al 10 % de la tasa de salida para reflejar el precarga paralela. Las intensidades de la red son factores de generación promedio nacional e ignoran los instrumentos basados ​​en el mercado, como los PPA y los REC, por lo que la cifra reportada por el propio operador generalmente será más baja. Úselo para escala y comparación, no para divulgación regulatoria. · Sugerir un factor mejor →

Por qué la división entrada/salida es más importante que el total del token

Casi todos los intentos de estimar la energía de la IA multiplican el total de tokens por un único número por token, y eso es incorrecto en un sentido importante. La inferencia del transformador tiene dos fases con perfiles de costos completamente diferentes. Prefill lee todo el mensaje en una pasada muy paralela, por lo que un mensaje de 1500 tokens cuesta poco más que uno de 150 tokens en las pilas de servicio modernas. Decode genera un token a la vez, cada uno de los cuales requiere un paso completo sobre los pesos del modelo, por lo que la longitud de salida escala la energía de manera casi lineal. La consecuencia práctica es que incluir más contexto en un mensaje es comparativamente barato y dejar que un modelo divague es costoso: exactamente lo contrario de la intuición con la que comienzan la mayoría de los equipos, y lo opuesto a cómo se forma la hoja de precios, ya que los proveedores también cobran los insumos con un descuento, pero ni mucho menos 10x.

El nivel de razonamiento es donde las huellas van a morir.

Se genera el rastro de pensamiento de un modelo de razonamiento. Pasa por el decodificador exactamente como lo hace la respuesta visible, pero nunca llega al usuario. Una solicitud que produce 200 tokens visibles después de 2000 tokens de deliberación ha generado 2200 tokens, y si ese modelo también es un orden de magnitud mayor por token que la alternativa de nivel medio, la energía por solicitud puede ser cincuenta veces mayor que la misma tarea respondida directamente. Ejecute la tabla de clases de modelo anterior con su propio volumen y la aritmética es clara. Esta es también la palanca más manejable: enrutar solicitudes directas a un nivel más pequeño y reservar el razonamiento para los casos que lo necesitan reduce tanto la factura como el espacio a la vez. Tamaño que comercia con el calculadora de ahorro de enrutamiento modelo, y comprueba cuánto te están costando los tokens de pensamiento en dólares con el calculadora de costo de token de razonamiento.

La energía es un error de redondeo comparado con lo que pagas, y ese es el punto

Si se ejecutan los números predeterminados, la electricidad detrás de dos millones de solicitudes de nivel medio cuesta decenas de dólares frente a una factura API de miles. Nadie cambia de proveedor para salvar eso. La razón para calcularlo de todos modos es que la cifra de carbono, a diferencia del costo de la energía, termina en un CSRD o en un cuestionario para el cliente donde tiene que ser defendible, y cada vez más en conversaciones de adquisiciones donde se le pregunta a un proveedor por las emisiones por unidad de servicio. La fila de la región es sobre la que se debe actuar: un cálculo idéntico en una red con bajas emisiones de carbono emite una quinceava parte de lo que emite en una con mucho carbón, algo que ninguna optimización del modelo puede igualar. Si la obligación de divulgación en sí es lo que lo trajo aquí, valore el programa de gobernanza circundante con el Calculadora de costes de cumplimiento de la Ley de IA de la UE.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
Costo de cumplimiento de la Ley de IA de la UEAhorros en rutas de modelosCosto de inferencia de GPULLM autohospedado frente a APILLM VRAM y concurrencia