Le coût de l'inférence auto-hébergée correspond au temps GPU par jeton. Le décodage spéculatif augmente le nombre de jetons par seconde sans modifier la sortie, ce qui réduit le coût par jeton – mais seulement si le brouillon est suffisamment précis pour que les jetons acceptés dépassent les passes de brouillon supplémentaires. C’est l’accélération nette, et non celle qui fait la une, qui apparaît sur la facture.
Base de référence vs spéculatif
Le décodage autorégressif simple est un jeton par passe cible. Le décodage spéculatif augmente le débit grâce à l'accélération nette, et le coût par jeton diminue avec lui – à condition que l'accélération nette soit égale à 1 ×.
| Mode | Débit (tok/s) | Coût / 1M | Coût / mois |
|---|
Sensibilité au taux d'acceptation
Le seul chiffre qui décide de tout est la fréquence à laquelle le projet devine correctement. En dessous du taux d'acceptation du seuil de rentabilité pour la profondeur de votre projet et vos frais généraux, le décodage spéculatif est une perte nette.
| Taux d'acceptation | Jetons / laissez-passer | Accélération nette | Coût / mois |
|---|
Pourquoi les suppositions acceptées sont presque gratuites
Le décodage d'un grand modèle, un jeton à la fois, est entravé par la bande passante mémoire : chaque jeton nécessite de diffuser l'ensemble du poids via le GPU, et ce coût fixe éclipse l'arithmétique. L’observation intelligente derrière le décodage spéculatif est que la vérification k les jetons proposés en une seule passe coûtent presque le même prix que le décodage d'un seul jeton : vous diffusez les poids une fois dans un sens ou dans l'autre. Ainsi, si un modèle de projet bon marché propose une poignée de jetons et que le grand modèle accepte la plupart d'entre eux, vous obtenez plusieurs jetons pour le prix d'un. Le résultat est identique au décodage normal car la cible vérifie toujours chaque jeton et rejette tout ce qu'elle n'aurait pas produit ; seul le débit change. Sur l'inférence auto-hébergée, où votre facture correspond essentiellement aux heures GPU divisées par les jetons produits, plus de jetons par seconde GPU représente de l'argent directement.
La formule, et les frais généraux qui mordent
Avec un taux d'acceptation par jeton un et une profondeur de tirant d'eau k, les jetons attendus que la cible émet par passe de vérification sont E = (1 − unek+1) ÷ (1 − une) — une série géométrique de suppositions acceptées plus un jeton bonus. C'est l'accélération brute. Le problème est le projet lui-même : il exécute k petites passes avant par cycle, donc si le projet coûte une fraction c de la cible par passage, chaque cycle coûte vraiment 1 + k·c target-equivalent units. Le l'accélération nette est E ÷ (1 + k·c), et le coût par jeton diminue 1 − 1 ÷ netSpeedup. Poussez k trop haut sur une charge de travail où a est faible et E croît lentement tandis que k · c croît linéairement - l'accélération nette descend vers et au-delà de 1 ×. C’est le mode d’échec que cet outil protège : un brouillon qui est en toute confiance erroné est pire que pas de brouillon du tout.
Où ça correspond
Le décodage spéculatif est un levier d’auto-hébergement, pas un levier d’API : les fournisseurs hébergés l’intègrent déjà, vous ne le capturez donc que lorsque vous exécutez le GPU. Associez-le avec le Calculateur de coût du cloud GPU pour fixer le prix du matériel que vous accélérez, le LLM VRAM et calculateur de concurrence pour voir comment le traitement par lots interagit avec lui, et le calculateur auto-hébergé vs API pour décider si l'exécution de votre propre modèle vaut mieux payer par jeton en premier lieu. Une astuce connexe, distiller un modèle plus petit, réduit le coût de la cible plutôt que de l'accélérer - les deux se cumulent.
Comment fonctionne cette calculatrice
Il calcule les jetons attendus par passe de vérification cible, E = (1 − ak+1)/(1 − a), à partir de votre taux d'acceptation a et de la profondeur du tirant d'eau k, puis l'accélération nette E/(1 + k·c) après le surcoût par passe du tirant d'eau c. Le coût de base par million est de GPU$/heure ÷ (débit × 3 600) × 1 000 000 ; le coût spéculatif le divise par l’accélération nette. Le coût mensuel correspond au volume de vos jetons de sortie à chaque taux, l'économie correspond à la différence et toute configuration dont l'accélération nette tombe en dessous de 1 × est signalée comme une perte nette.
Questions fréquemment posées
Qu’est-ce que le décodage spéculatif et pourquoi permet-il d’économiser de l’argent ?
Un petit brouillon de modèle propose des jetons que le grand modèle vérifie en un seul passage ; les suppositions acceptées sont un débit quasi libre. Sur l'inférence auto-hébergée, le coût est égal au temps GPU par jeton, donc un débit plus élevé signifie un coût par million inférieur – avec un résultat identique, puisque la cible vérifie chaque jeton.
Comment est calculée l’accélération nette ?
Jetons attendus par passe de vérification E = (1 − a^(k+1))/(1 − a) divisé par le projet de surcharge 1 + k·c. Le coût par jeton diminue de 1 à 1/netSpeedup.
Quand perd-il de l’argent ?
Lorsque l'acceptation est faible et que la profondeur de draft est élevée, les k passes de draft supplémentaires coûtent plus cher que ce que les jetons acceptés économisent, ramenant l'accélération nette en dessous de 1×. Cet outil signale ce cas.