—custo totalmente padrão
—salvo / mês
—misturado $/1 milhão
Para onde vai o dinheiro – por nível
Seu tráfego é dividido em três níveis. Tudo o que não é adiável ou crítico permanece no padrão. Lote/flex é cobrado com desconto; a prioridade carrega o prêmio.
| Nível | Compartilhar | Taxa versus padrão | Custo mensal |
|---|
Quanto você pode lotear? - o dial diferível
A maior alavanca é a parcela do volume que você pode transferir do padrão para o nível com desconto. Cada linha mantém fixa sua parcela prioritária e varia a parcela diferível; a economia é versus executar tudo no padrão.
| Participação diferível | Custo combinado | Salvo / mês | Salvando |
|---|
O token mais barato é aquele pelo qual você estava disposto a esperar
A maioria das equipes trata o preço do modelo como um único número, mas os mesmos tokens agora vêm em níveis, e a diferença entre eles é enorme: aproximadamente metade do preço para qualquer coisa que você possa adiar, um prêmio para qualquer coisa que você insista em servir instantaneamente. O erro em ambas as direções é a uniformidade – executar tudo no padrão deixa o desconto do lote na mesa, e executar tudo com prioridade paga uma taxa de latência nas chamadas que nenhum usuário está esperando. A vitória está quase sempre no meio chato: marque seu tráfego de acordo com quanto atraso ele pode absorver, coloque a metade off-line em lote ou flexível, mantenha o trabalho interativo comum no padrão e reserve prioridade para o conjunto restrito de caminhos onde uma resposta lenta realmente custa dinheiro. O prêmio de prioridade é o número que as pessoas mais julgam mal, então esta calculadora o isola – ela imprime os dólares extras por mês que você está pagando puramente pelo nível de serviço em sua parcela crítica, separados dos próprios tokens, então a decisão é uma comparação e não um encolher de ombros. Dimensione o desconto off-line precisamente no calculadora de economia de API em lote, empilhe-o com ocorrências de cache no calculadora de economia de cache imediatae dobre todas as alavancas juntas no Calculadora de otimização de custos LLM.
Economia de API em loteEconomia imediata de cacheOtimização de custos LLMPreços do nível LLMLatência do LLM
Como funciona esta calculadora
Ele avalia seu volume mensal total com base nas taxas de entrada e saída padrão para obter a linha de base totalmente padrão e, em seguida, divide esse custo por parcela em três níveis. A parcela diferida é cobrada com desconto em lote/flexível, a parcela crítica de latência é cobrada pela taxa padrão mais o prêmio de prioridade, e o que resta permanece no padrão. Somando os três dá-se o custo mensal combinado; a economia é a linha de base menos o valor combinado, e o valor combinado efetivo de US$/1 milhão divide o custo combinado pelo total de tokens. A tabela de varredura executa novamente toda a divisão em uma série de ações diferidas para que você possa ver a recompensa de mover mais trabalho off-line.
Perguntas frequentes
O que são níveis de serviço LLM e por que custam valores diferentes?
O mesmo modelo pode ser cobrado em diferentes níveis de processamento que negociam latência em relação ao preço. Padrão é o preço de tabela síncrono. As camadas em lote e flexíveis executam a mesma solicitação de forma assíncrona ou com prioridade mais baixa por aproximadamente metade da taxa padrão — elas são destinadas a trabalhos que podem esperar minutos ou horas, como classificação em massa, incorporações, resumo offline ou geração de relatórios noturnos. O processamento prioritário vai na direção oposta: você paga um prêmio acima do padrão para obter latência mais rápida e consistente e melhor confiabilidade durante picos de carga, o que é importante para chamadas interativas voltadas para o usuário. Os tokens são idênticos; você está pagando pela rapidez e confiabilidade com que eles são atendidos.
Quanto o processamento em lote ou flexível pode realmente economizar?
O desconto normalmente é de cerca de 50% da taxa padrão, portanto, cada fatia de tráfego que você pode mover para um lote ou nível flexível custa cerca de metade. O problema é a latência: os trabalhos em lote podem levar até um dia para retornar e as solicitações flexíveis podem ser mais lentas ou ocasionalmente enfileiradas, portanto, apenas o trabalho genuinamente adiável é qualificado. A alavanca é a parcela do seu volume que pode tolerar a espera – um pipeline que é 80% off-line em lote e 20% interativo chega perto de uma economia geral de 40%, enquanto um produto totalmente interativo não economiza nada dessa forma.
O processamento prioritário vale o prêmio?
Somente para o tráfego onde a latência tem valor real — um fluxo de checkout, um agente ativo, qualquer coisa que um usuário esteja esperando — e apenas para essa fatia, não para todo o seu volume. A prioridade normalmente custa significativamente mais do que o padrão por token, portanto, colocar todo o tráfego nela é a forma mais cara de execução. O teste honesto é se a resposta mais rápida e confiável vale os dólares extras que ela acrescenta, que esta calculadora imprime como um número independente: o prêmio de prioridade em dólares por mês para a ação crítica que você selecionou.
Como faço para dividir o tráfego entre níveis na prática?
Comece marcando cada caminho de chamada de acordo com quanto atraso ele pode tolerar. Qualquer coisa que um usuário não esteja esperando ativamente – trabalhos noturnos, preenchimentos, avaliações, enriquecimento em massa – vai para lote ou flexibilização com desconto. Qualquer coisa que um usuário esteja esperando, mas que não seja crítica para a latência, permanece no padrão. Reserve prioridade para o conjunto restrito de caminhos interativos onde uma resposta lenta ou perdida custa dinheiro. Em seguida, defina essas três ações aqui para ver a taxa combinada e a economia versus executar tudo no padrão.