Il costo dell'inferenza self-hosted è in termini di tempo GPU per token. La decodifica speculativa aumenta i token al secondo senza modificare l'output, quindi riduce il costo per token, ma solo se la bozza è sufficientemente accurata da far sì che i token accettati superino i passaggi di bozza extra. L'accelerazione netta, non quella del titolo, è ciò che appare in bolletta.

Draft ≈ un modello ~10–20× più piccolo del bersaglio
gettoni/verifica passaggio (grezzo)
accelerazione netta
costo / 1 milione (con specifiche)
risparmio mensile

Baseline vs speculativo

La semplice decodifica autoregressiva è un token per passaggio target. La decodifica speculativa aumenta il throughput grazie all'aumento di velocità netto e il costo per token diminuisce con esso, a condizione che l'aumento di velocità netto si azzeri di 1×.

ModalitàProduttività (tok/s)Costo/1 milioneCosto/mese

Sensibilità al tasso di accettazione

L'unico numero che decide tutto è quanto spesso la bozza indovina. Al di sotto del tasso di accettazione del pareggio per la profondità del progetto e le spese generali, la decodifica speculativa rappresenta una perdita netta.

Tasso di accettazioneGettoni/passaggioAccelerazione nettaCosto/mese
⚠️ Modello, luglio 2026. Il throughput e le velocità della GPU sono cifre di riferimento modificabili per la decodifica legata alla larghezza di banda della memoria; i numeri reali dipendono dal modello, dalla quantizzazione, dalla dimensione del batch e dallo stack di servizio (vLLM, TGI, TensorRT-LLM). Il tasso di accettazione dipende dal carico di lavoro e dalla bozza: misuralo sul tuo traffico. Il modello di costo presuppone che prevalga la decodifica e che un passaggio in avanti target su k+1 posizioni costi circa una decodifica di token, il che vale per il servizio con latenza limitata a batch singolo/batch; il batching pesante riduce il guadagno. · Segnala un problema →

Perché le ipotesi accettate sono quasi gratuite

La decodifica di un modello di grandi dimensioni, un token alla volta, è ostacolata dalla larghezza di banda della memoria: ogni singolo token richiede lo streaming dell'intero set di pesi attraverso la GPU e questo costo fisso sminuisce l'aritmetica. L'osservazione intelligente dietro la decodificazione speculativa è quella verifica k i token proposti in un passaggio in avanti costano quasi come la decodifica di un singolo token: i pesi vengono trasmessi una volta in entrambi i casi. Quindi, se un modello di bozza economico propone una manciata di token e il modello grande ne accetta la maggior parte, si ottengono diversi token al prezzo di uno. L'output è identico alla normale decodifica perché la destinazione controlla comunque ogni token e rifiuta tutto ciò che non avrebbe prodotto; cambia solo il throughput. Nell'inferenza self-hosted, in cui il conto è essenzialmente rappresentato dalle ore di GPU divise per i token prodotti, più token per GPU al secondo equivalgono a denaro direttamente dall'alto.

The formula, and the overhead that bites

Con un tasso di accettazione per token UN e una profondità di progetto k, i token previsti che la destinazione emette per ogni passaggio di verifica E = (1 − ak+1) ÷ (1 − a) - una serie geometrica di ipotesi accettate più un gettone bonus. Questa è la vera accelerazione. Il problema è il tiraggio stesso: esegue k piccoli passaggi in avanti per ciclo, quindi se il tiraggio costa una frazione C del target per passaggio, ogni ciclo costa davvero 1 + k·c unità equivalenti al bersaglio. IL l'accelerazione netta è E ÷ (1 + k·c)e il costo per token diminuisce 1 − 1 ÷ netSpeedup. Spingere k troppo in alto su un carico di lavoro in cui a è basso ed E cresce lentamente mentre k·c cresce linearmente: l'accelerazione netta diminuisce verso e oltre 1×. Questa è la modalità di fallimento protetta da questo strumento: una bozza sicuramente sbagliata è peggiore di nessuna bozza.

Dove si adatta

La decodifica speculativa è una leva di self-hosting, non API: i provider ospitati la prezzano già, quindi la acquisisci solo quando esegui la GPU. Abbinalo al Calcolatore dei costi del cloud GPU per valutare l'hardware che stai accelerando, il LLM VRAM e calcolatore di concorrenza per vedere come interagisce il batching con esso e il file calcolatore self-hosted e API per decidere se eseguire il proprio modello è meglio del pagamento per token in primo luogo. Un trucco correlato, distillando un modello più piccolo, riduce il costo del bersaglio invece di accelerarlo: i due si accumulano.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Costo del cloud GPULLM VRAM e concorrenzaSelf-hosted e APIROI della distillazione del modello

Strumenti e hosting

📈TradingViewHostingerIA intricata

Come funziona questa calcolatrice

Calcola i token previsti per passaggio di verifica del target, E = (1 − ak+1)/(1 − a), dal tasso di accettazione a e dalla profondità di pescaggio k, quindi l'accelerazione netta E/(1 + k·c) dopo il sovraccarico per passaggio c del pescaggio. Il costo di base per milione è GPU$/ora ÷ (throughput × 3600) × 1.000.000; il costo speculativo lo divide per l’accelerazione netta. Il costo mensile è il volume dei token di output a ciascuna tariffa, il risparmio è la differenza e qualsiasi configurazione la cui velocità netta scende al di sotto di 1× viene contrassegnata come una perdita netta.

Domande frequenti

Cos'è la decodificazione speculativa e perché fa risparmiare denaro?

Un modello di bozza piccola propone token che il modello grande verifica in un unico passaggio; le ipotesi accettate sono un throughput quasi gratuito. Nell'inferenza self-hosted, il costo è pari al tempo GPU per token, quindi un throughput più elevato significa un costo per milione inferiore, con output identico, poiché la destinazione controlla ogni token.

Come viene calcolata la velocità netta?

Gettoni previsti per passaggio di verifica E = (1 − a^(k+1))/(1 − a) diviso per le spese generali di bozza 1 + k·c. Il costo per token diminuisce di 1 − 1/netSpeedup.

Quando perde soldi?

Quando l'accettazione è bassa e la profondità del draft è elevata, i k passaggi extra di draft costano più del risparmio dei token accettati, riducendo l'accelerazione netta al di sotto di 1×. Questo strumento segnala questo caso.

Impara e confronta
Confronta 387 modelli →Prezzo per modello →