O custo de inferência auto-hospedada é o tempo de GPU por token. A decodificação especulativa aumenta tokens por segundo sem alterar a saída, portanto, reduz o custo por token – mas apenas se o rascunho for preciso o suficiente para que os tokens aceitos superem as passagens extras do rascunho. A aceleração da rede, e não a da manchete, é o que aparece na conta.

Rascunho ≈ um modelo ~10–20× menor que o alvo
tokens / verificação de passagem (bruto)
aceleração líquida
custo / 1 milhão (com especificações)
poupança mensal

Linha de base vs especulativa

A decodificação autorregressiva simples é um token por passagem de destino. A decodificação especulativa aumenta o rendimento pela aceleração da rede, e o custo por token cai com ela – desde que a aceleração da rede seja 1×.

ModoTaxa de transferência (tok/s)Custo / 1 milhãoCusto/mês

Sensibilidade à taxa de aceitação

O único número que decide tudo é a frequência com que o draft acerta. Abaixo da taxa de aceitação do ponto de equilíbrio para a profundidade e sobrecarga do rascunho, a decodificação especulativa é uma perda líquida.

Taxa de aceitaçãoTokens/passeAceleração líquidaCusto/mês
⚠️ Modelo, julho de 2026. Taxas de transferência e GPU são números de referência editáveis ​​para decodificação vinculada à largura de banda da memória; os números reais dependem do modelo, quantização, tamanho do lote e pilha de serviços (vLLM, TGI, TensorRT-LLM). A taxa de aceitação é específica da carga de trabalho e do rascunho – meça-a em seu tráfego. O modelo de custo assume que a decodificação domina e uma passagem direta de destino sobre k+1 posições custa cerca de uma decodificação de token, o que vale para serviço com latência limitada de lote único/baixo; lotes pesados ​​restringem o ganho. · Relate um problema →

Por que as suposições aceitas são quase gratuitas

A decodificação de um modelo grande, um token por vez, é prejudicada pela largura de banda da memória: cada token requer streaming de todo o peso definido através da GPU, e esse custo fixo supera a aritmética. A observação inteligente por trás da decodificação especulativa é que a verificação k os tokens propostos em um passe direto custam quase o mesmo que decodificar um único token – você transmite os pesos uma vez em qualquer direção. Portanto, se um modelo de rascunho barato propõe um punhado de tokens e o modelo grande aceita a maioria deles, você obtém vários tokens pelo preço de um. A saída é idêntica à decodificação normal porque o alvo ainda verifica cada token e rejeita tudo o que não teria produzido; apenas a taxa de transferência muda. Na inferência auto-hospedada, onde sua conta é essencialmente horas de GPU divididas por tokens produzidos, mais tokens por segundo de GPU significa dinheiro direto.

A fórmula e a sobrecarga que afeta

Com uma taxa de aceitação por token um e uma profundidade de rascunho k, os tokens esperados que o alvo emite por passagem de verificação são E = (1 − umak+1) ÷ (1 − uma) — uma sequência geométrica de suposições aceitas mais um token de bônus. Essa é a aceleração bruta. O problema é o calado em si: ele executa k pequenos passes para frente por ciclo, portanto, se o calado custar uma fração c da meta por passagem, cada ciclo realmente custa 1 + k·c unidades equivalentes ao alvo. O a aceleração líquida é E ÷ (1 + k·c), e o custo por token cai em 1 − 1 ÷ netSpeedup. Empurre k muito alto em uma carga de trabalho onde a é baixo e E cresce lentamente enquanto k·c cresce linearmente – a aceleração líquida diminui em direção e ultrapassa 1×. Esse é o modo de falha que esta ferramenta protege: um rascunho que está seguramente errado é pior do que nenhum rascunho.

Onde cabe

A decodificação especulativa é uma alavanca de auto-hospedagem, não uma alavanca de API – os provedores hospedados já têm um preço, então você a captura somente quando executa a GPU. Combine-o com o Calculadora de custos de nuvem GPU para definir o preço do hardware que você está acelerando, o LLM VRAM e calculadora de simultaneidade para ver como o lote interage com ele e o calculadora auto-hospedada vs API para decidir se executar seu próprio modelo é melhor do que pagar por token em primeiro lugar. Um truque relacionado, destilando um modelo menor, reduz o custo do próprio alvo em vez de acelerá-lo – os dois se acumulam.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Custo da nuvem GPULLM VRAM e simultaneidadeAuto-hospedado vs APIROI de destilação do modelo

Trocas

BybitBinânciaOKXKuCoin

Ferramentas e hospedagem

📈 Visualização de NegociaçãoHospedeiro

Como funciona esta calculadora

Ele calcula os tokens esperados por passagem de verificação de destino, E = (1 - ak+1)/(1 − a), a partir de sua taxa de aceitação a e profundidade de calado k, então a aceleração líquida E/(1 + k·c) após a sobrecarga por passagem do calado c. O custo básico por milhão é GPU$/hora ÷ (taxa de transferência × 3.600) × 1.000.000; o custo especulativo divide isso pela aceleração líquida. O custo mensal é o volume do token de saída em cada taxa, a economia é a diferença e qualquer configuração cuja aceleração líquida caia abaixo de 1× é sinalizada como uma perda líquida.

Perguntas frequentes

O que é decodificação especulativa e por que economiza dinheiro?

Um pequeno rascunho de modelo propõe tokens que o grande modelo verifica em uma única passagem; suposições aceitas têm rendimento quase gratuito. Na inferência auto-hospedada, o custo é o tempo de GPU por token, portanto, maior rendimento significa menor custo por milhão – com saída idêntica, já que o alvo verifica cada token.

Como o speedup líquido é calculado?

Tokens esperados por passagem de verificação E = (1 − a^(k+1))/(1 − a) dividido pela sobrecarga de draft 1 + k·c. O custo por token cai em 1 − 1/netSpeedup.

Quando é que perde dinheiro?

Quando a aceitação é baixa e a profundidade do draft é alta, os k passes de draft extras custam mais do que os tokens salvos aceitos, reduzindo a aceleração líquida para menos de 1×. Esta ferramenta sinaliza esse caso.