Como funciona esta calculadora
O Calculadora de preços LLM combinada calcula o custo real de uma única chamada de API e o taxa efetiva por 1 milhão de token que resulta da mistura de tokens de entrada e saída. Você insere quatro valores: o do modelo preço de entrada por 1 milhão de tokens, isso é preço de saída por 1 milhão de tokens, e o tokens de entrada e saída usados por chamada. A ferramenta multiplica cada contagem de tokens por sua taxa de correspondência e soma os dois, de modo que o custo por chamada seja determinado tanto pelos preços publicados quanto pelo seu mix real de tokens. Como os tokens de saída geralmente custam várias vezes mais do que os tokens de entrada, uma chamada com muito texto gerado pode custar muito mais do que o comprimento de entrada sugere.
A taxa combinada é importante porque um único preço de tabela esconde o que você realmente pagará. Um modelo com entrada barata, mas saída cara, pode acabar sendo mais caro do que um rival, uma vez que seu proporção de token real é aplicado. A dica prática: compare as contagens de tokens com uma chamada representativa, em vez de com o melhor caso, e depois compare os modelos no taxa combinada por 1 milhão em vez do preço de entrada principal. Observe o lado da saída mais de perto - cortar respostas detalhadas ou limitar o comprimento da saída geralmente reduz o custo mais do que reduzir o prompt.
Perguntas frequentes
Por que a produção é mais cara do que a entrada?
A geração de tokens exige mais computação do que a leitura deles, portanto, os provedores fixam o preço da produção cerca de 3 a 5 vezes mais alto do que a entrada. Um prompt com um contexto enorme, mas com uma resposta curta, ainda pode ser dominado por alguns tokens de saída caros — ou o contrário, dependendo do seu mix de tokens.
O que é um preço de token combinado?
Sua verdadeira taxa efetiva, uma vez que a entrada e a saída são ponderadas pela quantidade de cada uma que você realmente usa. Os preços anunciados são divididos; a taxa combinada informa quanto custa uma chamada real por token, que é o que você deve usar para margem e previsão.