El costo de la inferencia autohospedada es el tiempo de GPU por token. La decodificación especulativa aumenta los tokens por segundo sin cambiar el resultado, por lo que reduce el costo por token, pero solo si el borrador es lo suficientemente preciso como para que los tokens aceptados superen los pases de borrador adicionales. La aceleración neta, no la del titular, es lo que aparece en el billete.

Borrador ≈ un modelo ~10–20× más pequeño que el objetivo
tokens / verificar pase (sin procesar)
aceleración neta
costo / 1M (con especificaciones)
ahorro mensual

Línea de base vs especulativa

La decodificación autorregresiva simple es un token por pase de destino. La decodificación especulativa aumenta el rendimiento mediante la aceleración neta, y el costo por token disminuye con ella, siempre que la aceleración neta se aclare 1x.

ModoRendimiento (tok/s)Costo / 1MCosto / mes

Sensibilidad a la tasa de aceptación.

El único número que decide todo es la frecuencia con la que el draft acierta. Por debajo de la tasa de aceptación del punto de equilibrio para la profundidad del borrador y los gastos generales, la decodificación especulativa es una pérdida neta.

Tasa de aceptaciónFichas / paseaceleración netaCosto / mes
⚠️ Modelo, julio de 2026. Las tasas de rendimiento y GPU son cifras de referencia editables para la decodificación limitada por ancho de banda de memoria; Los números reales dependen del modelo, la cuantificación, el tamaño del lote y la pila de entrega (vLLM, TGI, TensorRT-LLM). La tasa de aceptación depende de la carga de trabajo y del borrador: mídala en función de su tráfico. El modelo de costos supone que la decodificación domina y que un paso hacia adelante objetivo sobre k+1 posiciones cuesta alrededor de una decodificación de token, lo cual es válido para el servicio vinculado a latencia de lote único/baja; el procesamiento por lotes intenso reduce la ganancia. · Informar un problema →

Por qué las conjeturas aceptadas son casi gratuitas

La decodificación de un modelo grande, un token a la vez, se ve obstaculizada por el ancho de banda de la memoria: cada token requiere transmitir todo el peso establecido a través de la GPU, y ese costo fijo eclipsa la aritmética. La inteligente observación detrás de la decodificación especulativa es que verificar k Los tokens propuestos en un pase directo cuestan casi lo mismo que decodificar un solo token: transmite los pesos una vez en cualquier sentido. Entonces, si un modelo borrador barato propone un puñado de tokens y el modelo grande acepta la mayoría de ellos, obtendrás varios tokens por el precio de uno. El resultado es idéntico a la decodificación normal porque el objetivo aún verifica cada token y rechaza todo lo que no habría producido; sólo cambia el rendimiento. En la inferencia autohospedada, donde su factura es esencialmente horas de GPU divididas por los tokens producidos, más tokens por segundo de GPU es dinero directo.

La fórmula y la sobrecarga que muerde.

Con una tasa de aceptación por token a y una profundidad de tiro k, los tokens esperados que el objetivo emite por pase de verificación son mi = (1 - unk+1) ÷ (1 − a) — una serie geométrica de conjeturas aceptadas más una ficha de bonificación. Esa es la aceleración bruta. El problema es el draft en sí: ejecuta k pequeños pases hacia adelante por ciclo, por lo que si el draft cuesta una fracción do del objetivo por pasada, cada ciclo realmente cuesta 1 + k·c unidades equivalentes al objetivo. El la aceleración neta es E ÷ (1 + k·c), y el costo por token cae 1 − 1 ÷ netSpeedup. Empuje k demasiado alto en una carga de trabajo donde a es baja y E crece lentamente mientras k·c crece linealmente: la aceleración neta desciende hacia 1× y lo supera. Ése es el modo de fallo que protege esta herramienta: un borrador que está claramente equivocado es peor que ningún borrador.

donde encaja

La decodificación especulativa es una palanca de autohospedaje, no de API; los proveedores alojados ya la valoran, por lo que la captura solo cuando ejecuta la GPU. Combínalo con el Calculadora de costos de nube de GPU para fijar el precio del hardware que está acelerando, el LLM VRAM y calculadora de concurrencia para ver cómo interactúa el procesamiento por lotes con él, y el calculadora autohospedada vs API para decidir si ejecutar su propio modelo es mejor que pagar por token en primer lugar. Un truco relacionado, destilando un modelo más pequeño, reduce el costo del objetivo en lugar de acelerarlo: los dos se acumulan.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
Costo de la nube de GPULLM VRAM y concurrenciaAutohospedado frente a APIModelo ROI de destilación

Intercambios

BybitbinanceOKXKuCoin

Herramientas y alojamiento

📈 Vista comercialHostinger

Cómo funciona esta calculadora

Calcula los tokens esperados por pase de verificación de destino, E = (1 − ak+1)/(1 − a), a partir de su tasa de aceptación a y profundidad de calado k, luego la aceleración neta E/(1 + k·c) después de la sobrecarga por pasada del calado c. El costo base por millón es GPU$/hora ÷ (rendimiento × 3600) × 1.000.000; el costo especulativo lo divide por la aceleración neta. El costo mensual es el volumen de tokens de salida en cada tarifa, el ahorro es la diferencia y cualquier configuración cuya aceleración neta caiga por debajo de 1× se marca como una pérdida neta.

Preguntas frecuentes

¿Qué es la decodificación especulativa y por qué ahorra dinero?

Un modelo borrador pequeño propone tokens que el modelo grande verifica en una sola pasada; Las conjeturas aceptadas son un rendimiento casi libre. En la inferencia autohospedada, el costo es el tiempo de GPU por token, por lo que un mayor rendimiento significa un menor costo por millón, con resultados idénticos, ya que el objetivo verifica cada token.

¿Cómo se calcula la aceleración neta?

Tokens esperados por pase de verificación E = (1 − a^(k+1))/(1 − a) dividido por el borrador de gastos generales 1 + k·c. El coste por token se reduce en 1 − 1/netSpeedup.

¿Cuándo pierde dinero?

Cuando la aceptación es baja y la profundidad del draft es alta, los k pases de draft adicionales cuestan más de lo que se ahorran los tokens aceptados, lo que reduce la velocidad neta por debajo de 1×. Esta herramienta señala ese caso.