O verificador é executado em todas as solicitações, não apenas nas escalações.
cascata / mês
sempre premium / mês
poupança
escalada do ponto de equilíbrio

De onde vem o custo em cascata

O modelo barato e o verificador são pagos integralmente; o modelo premium é pago apenas sobre a parcela escalonada. Sempre premium e uma divisão de tráfego simples são mostradas para comparação.

ComponenteCusto mensalCompartilhar

Economia nas taxas de escalonamento

A taxa de escalada é o fator de oscilação. Isso mantém todo o resto fixo e mostra onde a cascata para de superar o sempre premium – a linha do ponto de equilíbrio é marcada.

EscaladaCascata / mêsPoupançaVeredicto

Um modelo barato primeiro não é uma conta barata por padrão

O apelo de uma cascata é óbvio: a maioria das solicitações é fácil, um modelo pequeno as atende corretamente e pagar preços premium por um trabalho fácil é um desperdício. Execute primeiro o modelo barato, mantenha as respostas que passam na verificação e escale apenas as que falham – o resultado do FrugalGPT mostrou que isso pode corresponder à qualidade de um modelo de fronteira por uma fração do custo. A armadilha é tratar o modelo barato como o custo total. Você paga em cada solicitação, independentemente de a resposta sobreviver ou não. Você também paga um verificador em cada solicitação, porque algo precisa decidir o que será escalado, e esse algo geralmente é outra chamada de modelo. E na parcela que você escalar, você paga o modelo premium além da tentativa barata que você já fez. Some tudo isso e o quadro muda: a cascata economiza bastante quando o escalonamento é baixo, diminui à medida que o escalonamento aumenta e, além de uma taxa de equilíbrio, custa mais do que apenas chamar o modelo premium em tudo - porque você pagou o modelo barato e o verificador de graça e ainda pagou o preço premium integral. Esta calculadora avalia todas as três etapas a partir de suas próprias contagens e taxas de tokens, compara a cascata com sempre premium e com uma divisão de tráfego simples que nunca paga duas vezes e marca a taxa de escalonamento onde a aritmética muda. Se você encaminhar cada solicitação para um único modelo antecipadamente, em vez de escalar, avalie isso com o calculadora de roteador modelo; para empilhar cache, lote e outras alavancas no topo, use o calculadora de otimização de custos; e para comparar os dois modelos, consulte o comparação de modelos.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Modelo RoteadorOtimização de custosAutoconsistênciaComparação de modelos