O custo de inferência auto-hospedada é o tempo de GPU por token. A decodificação especulativa aumenta tokens por segundo sem alterar a saída, portanto, reduz o custo por token – mas apenas se o rascunho for preciso o suficiente para que os tokens aceitos superem as passagens extras do rascunho. A aceleração da rede, e não a da manchete, é o que aparece na conta.
Linha de base vs especulativa
A decodificação autorregressiva simples é um token por passagem de destino. A decodificação especulativa aumenta o rendimento pela aceleração da rede, e o custo por token cai com ela – desde que a aceleração da rede seja 1×.
| Modo | Taxa de transferência (tok/s) | Custo / 1 milhão | Custo/mês |
|---|
Sensibilidade à taxa de aceitação
O único número que decide tudo é a frequência com que o draft acerta. Abaixo da taxa de aceitação do ponto de equilíbrio para a profundidade e sobrecarga do rascunho, a decodificação especulativa é uma perda líquida.
| Taxa de aceitação | Tokens/passe | Aceleração líquida | Custo/mês |
|---|
Por que as suposições aceitas são quase gratuitas
A decodificação de um modelo grande, um token por vez, é prejudicada pela largura de banda da memória: cada token requer streaming de todo o peso definido através da GPU, e esse custo fixo supera a aritmética. A observação inteligente por trás da decodificação especulativa é que a verificação k os tokens propostos em um passe direto custam quase o mesmo que decodificar um único token – você transmite os pesos uma vez em qualquer direção. Portanto, se um modelo de rascunho barato propõe um punhado de tokens e o modelo grande aceita a maioria deles, você obtém vários tokens pelo preço de um. A saída é idêntica à decodificação normal porque o alvo ainda verifica cada token e rejeita tudo o que não teria produzido; apenas a taxa de transferência muda. Na inferência auto-hospedada, onde sua conta é essencialmente horas de GPU divididas por tokens produzidos, mais tokens por segundo de GPU significa dinheiro direto.
A fórmula e a sobrecarga que afeta
Com uma taxa de aceitação por token um e uma profundidade de rascunho k, os tokens esperados que o alvo emite por passagem de verificação são E = (1 − umak+1) ÷ (1 − uma) — uma sequência geométrica de suposições aceitas mais um token de bônus. Essa é a aceleração bruta. O problema é o calado em si: ele executa k pequenos passes para frente por ciclo, portanto, se o calado custar uma fração c da meta por passagem, cada ciclo realmente custa 1 + k·c unidades equivalentes ao alvo. O a aceleração líquida é E ÷ (1 + k·c), e o custo por token cai em 1 − 1 ÷ netSpeedup. Empurre k muito alto em uma carga de trabalho onde a é baixo e E cresce lentamente enquanto k·c cresce linearmente – a aceleração líquida diminui em direção e ultrapassa 1×. Esse é o modo de falha que esta ferramenta protege: um rascunho que está seguramente errado é pior do que nenhum rascunho.
Onde cabe
A decodificação especulativa é uma alavanca de auto-hospedagem, não uma alavanca de API – os provedores hospedados já têm um preço, então você a captura somente quando executa a GPU. Combine-o com o Calculadora de custos de nuvem GPU para definir o preço do hardware que você está acelerando, o LLM VRAM e calculadora de simultaneidade para ver como o lote interage com ele e o calculadora auto-hospedada vs API para decidir se executar seu próprio modelo é melhor do que pagar por token em primeiro lugar. Um truque relacionado, destilando um modelo menor, reduz o custo do próprio alvo em vez de acelerá-lo – os dois se acumulam.
Como funciona esta calculadora
Ele calcula os tokens esperados por passagem de verificação de destino, E = (1 - ak+1)/(1 − a), a partir de sua taxa de aceitação a e profundidade de calado k, então a aceleração líquida E/(1 + k·c) após a sobrecarga por passagem do calado c. O custo básico por milhão é GPU$/hora ÷ (taxa de transferência × 3.600) × 1.000.000; o custo especulativo divide isso pela aceleração líquida. O custo mensal é o volume do token de saída em cada taxa, a economia é a diferença e qualquer configuração cuja aceleração líquida caia abaixo de 1× é sinalizada como uma perda líquida.
Perguntas frequentes
O que é decodificação especulativa e por que economiza dinheiro?
Um pequeno rascunho de modelo propõe tokens que o grande modelo verifica em uma única passagem; suposições aceitas têm rendimento quase gratuito. Na inferência auto-hospedada, o custo é o tempo de GPU por token, portanto, maior rendimento significa menor custo por milhão – com saída idêntica, já que o alvo verifica cada token.
Como o speedup líquido é calculado?
Tokens esperados por passagem de verificação E = (1 − a^(k+1))/(1 − a) dividido pela sobrecarga de draft 1 + k·c. O custo por token cai em 1 − 1/netSpeedup.
Quando é que perde dinheiro?
Quando a aceitação é baixa e a profundidade do draft é alta, os k passes de draft extras custam mais do que os tokens salvos aceitos, reduzindo a aceleração líquida para menos de 1×. Esta ferramenta sinaliza esse caso.