Perguntas frequentes
Como calculo o custo por token na minha própria GPU?
Pegue o preço por hora da GPU e divida por quantos tokens ela realmente atende por hora. Isso é a taxa de transferência (tokens/s) vezes 3.600, dimensionada de acordo com sua utilização real. Uma GPU faturada continuamente, mas meio ociosa, atende metade dos tokens, portanto, seu custo por token dobra em relação ao rendimento da folha de dados.
Por que meu custo de auto-hospedagem é maior do que o esperado?
Quase sempre utilização e lote. A taxa de transferência do benchmark pressupõe carga completa em lote; o tráfego real é intermitente, então a GPU fica ociosa entre as solicitações enquanto o medidor é executado. O lote contínuo, o dimensionamento correto da GPU e a consolidação do tráfego em menos GPUs e mais ocupadas são as principais maneiras de reduzir o custo por token.