Os pesos são a parte fácil. Ajustar o modelo é um cálculo de uma linha e não diz quase nada. O que decide se você pode atender oito ou oitenta usuários é o cache KV – memória que se adapta ao comprimento do contexto e com todas as sequências simultâneas em vôo. Essa ferramenta dimensiona ambos e, em seguida, converte a capacidade resultante em um custo por milhão de tokens que você pode manter em relação a uma conta de API.

pesos
solicitações simultâneas
Cache/solicitação KV
seus tokens de $/1 milhão

Simultaneidade e custo unitário por comprimento de contexto

Mesmo modelo, mesma GPU, mesmo dinheiro – apenas a janela de contexto de cada solicitação traz alterações. Esta é a tabela que transforma “vamos apenas aumentar max_model_len” em uma decisão de capacidade.

ContextoKV/solicitaçãoSimultâneoTokens/seg.$/1 milhão de tokens

O penhasco de utilização

Uma GPU cobra por hora, não por token. Seu verdadeiro custo unitário é o valor principal dividido pelo seu ciclo de trabalho - é aqui que a maioria dos casos de negócios de auto-hospedagem desmorona silenciosamente.

Utilização médiaTokens efetivos/s$/1 milhão de tokensversus API
⚠️ Estimativa de capacidade, não uma referência. Os números de VRAM usam GB decimais (1 GB = 10⁹ bytes) para corresponder à forma como os fornecedores cotam a memória do cartão. Pilhas de serviço reais adicionam preenchimento de bloco de atenção paginada, reutilização de cache de prefixo opcional e espaço de agendamento, portanto, trate o número de simultaneidade como um limite superior e planeje 20-30% menos. A taxa de transferência é sua entrada – meça-a em seu próprio hardware, em vez de confiar em uma folha de especificações. Compare as taxas atuais da API por token no comparação de preços de modelos. · Informar preço desatualizado →

Ajustar o modelo não é o mesmo que servi-lo

O conselho que você encontra em todos os lugares é que um modelo 70B no INT4 precisa de cerca de 35 GB, portanto cabe em um único cartão de 80 GB com espaço de sobra. Isso é verdade e é quase inútil, porque descreve um modelo ocioso. No momento em que as solicitações chegam, cada sequência em voo aloca seu próprio cache KV: dois tensores por camada, dimensionados pelas cabeças KV vezes a dimensão da cabeça, mantidos para cada token no contexto dessa sequência. Com 80 camadas, cabeçotes de 8 KV, 128 dimensões e FP16 que equivale a 327.680 bytes por token – um terço de megabyte – que em um contexto de 8K equivale a cerca de 2,7 GB por solicitação simultânea. Os 45 GB de espaço que pareciam tão confortáveis ​​equivalem a cerca de uma dúzia de usuários, e o décimo terceiro fica na fila. O planejamento de capacidade para inferência é o planejamento de cache KV; os pesos apenas definem a taxa de entrada.

A contagem de cabeças KV é o número que realmente se move

A atenção à consulta agrupada é a razão pela qual os modelos modernos de peso aberto são utilizáveis, e é rotineiramente ignorada por qualquer pessoa que dimensione o hardware a partir de uma contagem de parâmetros. Um modelo com 64 cabeçotes de atenção e cabeçotes de 8 KV armazena um oitavo do cache de um design de múltiplos cabeçotes equivalente, que converte quase linearmente em oito vezes a simultaneidade na mesma placa. Experimente a predefinição de múltiplos cabeçotes de 13B acima em comparação com a predefinição de 70B: o modelo menor geralmente é aquele que fica sem memória primeiro, o que não é intuitivo até que você veja para onde vão os bytes. Reduzir pela metade a precisão do KV para FP8 dobra a simultaneidade novamente por um custo modesto de precisão. Esses dois switches movimentam a capacidade muito mais do que comprar uma placa maior e não custam nada.

A utilização decide a economia, não o hardware

A mesa final é aquela que encerra honestamente a maioria dos projetos de auto-hospedagem. Um H100 alugado custa os mesmos US$ 2,50 por hora às 3h sem tráfego e no horário de pico, então seu custo real por milhão de tokens é o número principal dividido pelo seu ciclo de trabalho médio. Sirva com 20% de utilização e você estará pagando cinco vezes o que o número otimista da calculadora sugere – e em comparação com as taxas API de commodities para um modelo pequeno, isso não chega nem perto. A auto-hospedagem vence em volume sustentado, saturado e previsível, em cargas de trabalho com residência de dados ou restrições de latência que uma API não consegue atender e em modelos que ninguém vende por token. Perde no tráfego intenso e perde silenciosamente, porque a fatura é fixa e a capacidade desperdiçada nunca aparece como um item de linha. Cruze a conclusão com a calculadora LLM vs API auto-hospedada, avalie o próprio hardware com o Calculadora de custos de inferência de GPU, e se a resposta for marginal, observe um modelo menor destilado ou cache de prompt antes de comprar um rack.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
LLM auto-hospedado vs APICusto de inferência de GPUCusto da nuvem GPUROI de destilação do modeloLatência do LLMCusto da janela de contexto