Le coût de l'inférence auto-hébergée correspond au temps GPU par jeton. Le décodage spéculatif augmente le nombre de jetons par seconde sans modifier la sortie, ce qui réduit le coût par jeton – mais seulement si le brouillon est suffisamment précis pour que les jetons acceptés dépassent les passes de brouillon supplémentaires. C’est l’accélération nette, et non celle qui fait la une, qui apparaît sur la facture.

Tirant d'eau ≈ un modèle ~10–20× plus petit que la cible
jetons / vérifier le pass (brut)
accélération nette
coût / 1M (avec spécifications)
épargne mensuelle

Base de référence vs spéculatif

Le décodage autorégressif simple est un jeton par passe cible. Le décodage spéculatif augmente le débit grâce à l'accélération nette, et le coût par jeton diminue avec lui – à condition que l'accélération nette soit égale à 1 ×.

ModeDébit (tok/s)Coût / 1MCoût / mois

Sensibilité au taux d'acceptation

Le seul chiffre qui décide de tout est la fréquence à laquelle le projet devine correctement. En dessous du taux d'acceptation du seuil de rentabilité pour la profondeur de votre projet et vos frais généraux, le décodage spéculatif est une perte nette.

Taux d'acceptationJetons / laissez-passerAccélération netteCoût / mois
⚠️ Modèle, juillet 2026. Les débits et les débits GPU sont des chiffres de référence modifiables pour le décodage lié à la bande passante mémoire ; les nombres réels dépendent du modèle, de la quantification, de la taille du lot et de la pile de diffusion (vLLM, TGI, TensorRT-LLM). Le taux d'acceptation dépend de la charge de travail et du brouillon : mesurez-le sur votre trafic. Le modèle de coût suppose que le décodage domine et qu'un passage cible sur k+1 positions coûte environ un décodage de jeton, ce qui est valable pour le service lié à une latence unique/faible lot ; un traitement par lots important réduit le gain. · Signaler un problème →

Pourquoi les suppositions acceptées sont presque gratuites

Le décodage d'un grand modèle, un jeton à la fois, est entravé par la bande passante mémoire : chaque jeton nécessite de diffuser l'ensemble du poids via le GPU, et ce coût fixe éclipse l'arithmétique. L’observation intelligente derrière le décodage spéculatif est que la vérification k les jetons proposés en une seule passe coûtent presque le même prix que le décodage d'un seul jeton : vous diffusez les poids une fois dans un sens ou dans l'autre. Ainsi, si un modèle de projet bon marché propose une poignée de jetons et que le grand modèle accepte la plupart d'entre eux, vous obtenez plusieurs jetons pour le prix d'un. Le résultat est identique au décodage normal car la cible vérifie toujours chaque jeton et rejette tout ce qu'elle n'aurait pas produit ; seul le débit change. Sur l'inférence auto-hébergée, où votre facture correspond essentiellement aux heures GPU divisées par les jetons produits, plus de jetons par seconde GPU représente de l'argent directement.

La formule, et les frais généraux qui mordent

Avec un taux d'acceptation par jeton un et une profondeur de tirant d'eau k, les jetons attendus que la cible émet par passe de vérification sont E = (1 − unek+1) ÷ (1 − une) — une série géométrique de suppositions acceptées plus un jeton bonus. C'est l'accélération brute. Le problème est le projet lui-même : il exécute k petites passes avant par cycle, donc si le projet coûte une fraction c de la cible par passage, chaque cycle coûte vraiment 1 + k·c target-equivalent units. Le l'accélération nette est E ÷ (1 + k·c), et le coût par jeton diminue 1 − 1 ÷ netSpeedup. Poussez k trop haut sur une charge de travail où a est faible et E croît lentement tandis que k · c croît linéairement - l'accélération nette descend vers et au-delà de 1 ×. C’est le mode d’échec que cet outil protège : un brouillon qui est en toute confiance erroné est pire que pas de brouillon du tout.

Où ça correspond

Le décodage spéculatif est un levier d’auto-hébergement, pas un levier d’API : les fournisseurs hébergés l’intègrent déjà, vous ne le capturez donc que lorsque vous exécutez le GPU. Associez-le avec le Calculateur de coût du cloud GPU pour fixer le prix du matériel que vous accélérez, le LLM VRAM et calculateur de concurrence pour voir comment le traitement par lots interagit avec lui, et le calculateur auto-hébergé vs API pour décider si l'exécution de votre propre modèle vaut mieux payer par jeton en premier lieu. Une astuce connexe, distiller un modèle plus petit, réduit le coût de la cible plutôt que de l'accélérer - les deux se cumulent.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Coût du cloud GPULLM VRAM et concurrenceAuto-hébergé vs APIModèle de retour sur investissement de la distillation

Échanges

BybitBinanceOKXKuCoin

Outils et hébergement

📈TradingViewHébergeur

Comment fonctionne cette calculatrice

Il calcule les jetons attendus par passe de vérification cible, E = (1 − ak+1)/(1 − a), à partir de votre taux d'acceptation a et de la profondeur du tirant d'eau k, puis l'accélération nette E/(1 + k·c) après le surcoût par passe du tirant d'eau c. Le coût de base par million est de GPU$/heure ÷ (débit × 3 600) × 1 000 000 ; le coût spéculatif le divise par l’accélération nette. Le coût mensuel correspond au volume de vos jetons de sortie à chaque taux, l'économie correspond à la différence et toute configuration dont l'accélération nette tombe en dessous de 1 × est signalée comme une perte nette.

Questions fréquemment posées

Qu’est-ce que le décodage spéculatif et pourquoi permet-il d’économiser de l’argent ?

Un petit brouillon de modèle propose des jetons que le grand modèle vérifie en un seul passage ; les suppositions acceptées sont un débit quasi libre. Sur l'inférence auto-hébergée, le coût est égal au temps GPU par jeton, donc un débit plus élevé signifie un coût par million inférieur – avec un résultat identique, puisque la cible vérifie chaque jeton.

Comment est calculée l’accélération nette ?

Jetons attendus par passe de vérification E = (1 − a^(k+1))/(1 − a) divisé par le projet de surcharge 1 + k·c. Le coût par jeton diminue de 1 à 1/netSpeedup.

Quand perd-il de l’argent ?

Lorsque l'acceptation est faible et que la profondeur de draft est élevée, les k passes de draft supplémentaires coûtent plus cher que ce que les jetons acceptés économisent, ramenant l'accélération nette en dessous de 1×. Cet outil signale ce cas.