Os pesos são a parte fácil. Ajustar o modelo é um cálculo de uma linha e não diz quase nada. O que decide se você pode atender oito ou oitenta usuários é o cache KV – memória que se adapta ao comprimento do contexto e com todas as sequências simultâneas em vôo. Essa ferramenta dimensiona ambos e, em seguida, converte a capacidade resultante em um custo por milhão de tokens que você pode manter em relação a uma conta de API.
Simultaneidade e custo unitário por comprimento de contexto
Mesmo modelo, mesma GPU, mesmo dinheiro – apenas a janela de contexto de cada solicitação traz alterações. Esta é a tabela que transforma “vamos apenas aumentar max_model_len” em uma decisão de capacidade.
| Contexto | KV/solicitação | Simultâneo | Tokens/seg. | $/1 milhão de tokens |
|---|
O penhasco de utilização
Uma GPU cobra por hora, não por token. Seu verdadeiro custo unitário é o valor principal dividido pelo seu ciclo de trabalho - é aqui que a maioria dos casos de negócios de auto-hospedagem desmorona silenciosamente.
| Utilização média | Tokens efetivos/s | $/1 milhão de tokens | versus API |
|---|
Ajustar o modelo não é o mesmo que servi-lo
O conselho que você encontra em todos os lugares é que um modelo 70B no INT4 precisa de cerca de 35 GB, portanto cabe em um único cartão de 80 GB com espaço de sobra. Isso é verdade e é quase inútil, porque descreve um modelo ocioso. No momento em que as solicitações chegam, cada sequência em voo aloca seu próprio cache KV: dois tensores por camada, dimensionados pelas cabeças KV vezes a dimensão da cabeça, mantidos para cada token no contexto dessa sequência. Com 80 camadas, cabeçotes de 8 KV, 128 dimensões e FP16 que equivale a 327.680 bytes por token – um terço de megabyte – que em um contexto de 8K equivale a cerca de 2,7 GB por solicitação simultânea. Os 45 GB de espaço que pareciam tão confortáveis equivalem a cerca de uma dúzia de usuários, e o décimo terceiro fica na fila. O planejamento de capacidade para inferência é o planejamento de cache KV; os pesos apenas definem a taxa de entrada.
A contagem de cabeças KV é o número que realmente se move
A atenção à consulta agrupada é a razão pela qual os modelos modernos de peso aberto são utilizáveis, e é rotineiramente ignorada por qualquer pessoa que dimensione o hardware a partir de uma contagem de parâmetros. Um modelo com 64 cabeçotes de atenção e cabeçotes de 8 KV armazena um oitavo do cache de um design de múltiplos cabeçotes equivalente, que converte quase linearmente em oito vezes a simultaneidade na mesma placa. Experimente a predefinição de múltiplos cabeçotes de 13B acima em comparação com a predefinição de 70B: o modelo menor geralmente é aquele que fica sem memória primeiro, o que não é intuitivo até que você veja para onde vão os bytes. Reduzir pela metade a precisão do KV para FP8 dobra a simultaneidade novamente por um custo modesto de precisão. Esses dois switches movimentam a capacidade muito mais do que comprar uma placa maior e não custam nada.
A utilização decide a economia, não o hardware
A mesa final é aquela que encerra honestamente a maioria dos projetos de auto-hospedagem. Um H100 alugado custa os mesmos US$ 2,50 por hora às 3h sem tráfego e no horário de pico, então seu custo real por milhão de tokens é o número principal dividido pelo seu ciclo de trabalho médio. Sirva com 20% de utilização e você estará pagando cinco vezes o que o número otimista da calculadora sugere – e em comparação com as taxas API de commodities para um modelo pequeno, isso não chega nem perto. A auto-hospedagem vence em volume sustentado, saturado e previsível, em cargas de trabalho com residência de dados ou restrições de latência que uma API não consegue atender e em modelos que ninguém vende por token. Perde no tráfego intenso e perde silenciosamente, porque a fatura é fixa e a capacidade desperdiçada nunca aparece como um item de linha. Cruze a conclusão com a calculadora LLM vs API auto-hospedada, avalie o próprio hardware com o Calculadora de custos de inferência de GPU, e se a resposta for marginal, observe um modelo menor destilado ou cache de prompt antes de comprar um rack.