Como funciona esta calculadora
O Calculadora de custos de inferência de GPU converte três entradas - seu Preço da GPU por hora, modelo taxa de transferência em tokens por segundo, e um porcentagem de utilização realista - para o verdadeiro custo por milhão de tokens para um modelo auto-hospedado. A ideia central é simples: uma hora de GPU compra um número fixo de tokens, portanto, dividir o custo por hora pelos tokens realmente produzidos dá o preço por token. A taxa de transferência define quantos tokens o hardware gera a cada segundo, enquanto os descontos de utilização refletem o tempo ocioso, lacunas de lote e tráfego que raramente mantém a GPU totalmente carregada.
A principal compensação é utilização. A taxa de transferência de referência pressupõe uma GPU constantemente ocupada, mas as cargas de trabalho reais ficam ociosas entre as solicitações, portanto, uma GPU alugada cobrada por hora pode custar muito mais por token do que o número do título sugere. Antes de se comprometer com a auto-hospedagem, estime seu verdadeiro utilização honesta e compare o resultado com o preço da API por token – o tráfego baixo e pontiagudo geralmente favorece uma API, enquanto o alto volume constante recompensa a propriedade do hardware.
Perguntas frequentes
Como calculo o custo por token na minha própria GPU?
Pegue o preço por hora da GPU e divida por quantos tokens ela realmente atende por hora. Isso é a taxa de transferência (tokens/s) vezes 3.600, dimensionada de acordo com sua utilização real. Uma GPU faturada continuamente, mas meio ociosa, atende metade dos tokens, portanto, seu custo por token dobra em relação ao rendimento da folha de dados.
Por que meu custo de auto-hospedagem é maior do que o esperado?
Quase sempre utilização e lote. A taxa de transferência do benchmark pressupõe carga completa em lote; o tráfego real é intermitente, então a GPU fica ociosa entre as solicitações enquanto o medidor é executado. O lote contínuo, o dimensionamento correto da GPU e a consolidação do tráfego em menos GPUs e mais ocupadas são as principais maneiras de reduzir o custo por token.