El costo de la inferencia autohospedada es el tiempo de GPU por token. La decodificación especulativa aumenta los tokens por segundo sin cambiar el resultado, por lo que reduce el costo por token, pero solo si el borrador es lo suficientemente preciso como para que los tokens aceptados superen los pases de borrador adicionales. La aceleración neta, no la del titular, es lo que aparece en el billete.
Línea de base vs especulativa
La decodificación autorregresiva simple es un token por pase de destino. La decodificación especulativa aumenta el rendimiento mediante la aceleración neta, y el costo por token disminuye con ella, siempre que la aceleración neta se aclare 1x.
| Modo | Rendimiento (tok/s) | Costo / 1M | Costo / mes |
|---|
Sensibilidad a la tasa de aceptación.
El único número que decide todo es la frecuencia con la que el draft acierta. Por debajo de la tasa de aceptación del punto de equilibrio para la profundidad del borrador y los gastos generales, la decodificación especulativa es una pérdida neta.
| Tasa de aceptación | Fichas / pase | aceleración neta | Costo / mes |
|---|
Por qué las conjeturas aceptadas son casi gratuitas
La decodificación de un modelo grande, un token a la vez, se ve obstaculizada por el ancho de banda de la memoria: cada token requiere transmitir todo el peso establecido a través de la GPU, y ese costo fijo eclipsa la aritmética. La inteligente observación detrás de la decodificación especulativa es que verificar k Los tokens propuestos en un pase directo cuestan casi lo mismo que decodificar un solo token: transmite los pesos una vez en cualquier sentido. Entonces, si un modelo borrador barato propone un puñado de tokens y el modelo grande acepta la mayoría de ellos, obtendrás varios tokens por el precio de uno. El resultado es idéntico a la decodificación normal porque el objetivo aún verifica cada token y rechaza todo lo que no habría producido; sólo cambia el rendimiento. En la inferencia autohospedada, donde su factura es esencialmente horas de GPU divididas por los tokens producidos, más tokens por segundo de GPU es dinero directo.
La fórmula y la sobrecarga que muerde.
Con una tasa de aceptación por token a y una profundidad de tiro k, los tokens esperados que el objetivo emite por pase de verificación son mi = (1 - unk+1) ÷ (1 − a) — una serie geométrica de conjeturas aceptadas más una ficha de bonificación. Esa es la aceleración bruta. El problema es el draft en sí: ejecuta k pequeños pases hacia adelante por ciclo, por lo que si el draft cuesta una fracción do del objetivo por pasada, cada ciclo realmente cuesta 1 + k·c unidades equivalentes al objetivo. El la aceleración neta es E ÷ (1 + k·c), y el costo por token cae 1 − 1 ÷ netSpeedup. Empuje k demasiado alto en una carga de trabajo donde a es baja y E crece lentamente mientras k·c crece linealmente: la aceleración neta desciende hacia 1× y lo supera. Ése es el modo de fallo que protege esta herramienta: un borrador que está claramente equivocado es peor que ningún borrador.
donde encaja
La decodificación especulativa es una palanca de autohospedaje, no de API; los proveedores alojados ya la valoran, por lo que la captura solo cuando ejecuta la GPU. Combínalo con el Calculadora de costos de nube de GPU para fijar el precio del hardware que está acelerando, el LLM VRAM y calculadora de concurrencia para ver cómo interactúa el procesamiento por lotes con él, y el calculadora autohospedada vs API para decidir si ejecutar su propio modelo es mejor que pagar por token en primer lugar. Un truco relacionado, destilando un modelo más pequeño, reduce el costo del objetivo en lugar de acelerarlo: los dos se acumulan.
Cómo funciona esta calculadora
Calcula los tokens esperados por pase de verificación de destino, E = (1 − ak+1)/(1 − a), a partir de su tasa de aceptación a y profundidad de calado k, luego la aceleración neta E/(1 + k·c) después de la sobrecarga por pasada del calado c. El costo base por millón es GPU$/hora ÷ (rendimiento × 3600) × 1.000.000; el costo especulativo lo divide por la aceleración neta. El costo mensual es el volumen de tokens de salida en cada tarifa, el ahorro es la diferencia y cualquier configuración cuya aceleración neta caiga por debajo de 1× se marca como una pérdida neta.
Preguntas frecuentes
¿Qué es la decodificación especulativa y por qué ahorra dinero?
Un modelo borrador pequeño propone tokens que el modelo grande verifica en una sola pasada; Las conjeturas aceptadas son un rendimiento casi libre. En la inferencia autohospedada, el costo es el tiempo de GPU por token, por lo que un mayor rendimiento significa un menor costo por millón, con resultados idénticos, ya que el objetivo verifica cada token.
¿Cómo se calcula la aceleración neta?
Tokens esperados por pase de verificación E = (1 − a^(k+1))/(1 − a) dividido por el borrador de gastos generales 1 + k·c. El coste por token se reduce en 1 − 1/netSpeedup.
¿Cuándo pierde dinero?
Cuando la aceptación es baja y la profundidad del draft es alta, los k pases de draft adicionales cuestan más de lo que se ahorran los tokens aceptados, lo que reduce la velocidad neta por debajo de 1×. Esta herramienta señala ese caso.