Dica: um produto de chat normalmente executa de 3 a 6 vezes mais tokens de entrada do que de saída (o histórico é reenviado a cada turno). Se você conhece apenas o total de tokens, divida-os em 80/20.

0 modelos se ajustam · classificados por nível de qualidade e, em seguida, espaço ·

ModeloProvedorCusto mensal% do orçamentoAltura livreNível

Os preços são estimativas de referência (). Informar preço desatualizado →

Como usar a coluna headroom

Headroom é quantas vezes seu volume atual pode crescer antes que o modelo estoure o orçamento. Um modelo com 45% do orçamento tem aproximadamente 2,2× espaço livre; em 90%, apenas 1,1× – o primeiro mês de crescimento o quebra. O uso do LLM quase sempre cresce mais rápido do que o planejado (conversas mais longas, novas tentativas, novos recursos adicionados silenciosamente), portanto, trate 2x de espaço como o mínimo prático para uma seleção de produção.

A jogada inteligente geralmente é uma par: um carro-chefe barato dentro do orçamento com 5 × + espaço para 80% das consultas fáceis, além de um carro-chefe usado com moderação para os 20% difíceis. O calculadora de roteamento de modelo mostra a matemática combinada e o tabela de comparação completa permite inspecionar qualquer modelo que este localizador apresente. Os preços aqui caem cerca de 10×/ano em capacidade constante – veja o rastreador de histórico de preços — portanto, repita esta verificação trimestralmente; o conjunto de modelos que cabem no seu orçamento cresce por conta própria.