✓ Última verificação: 29/07/2026· Frugal estilo GPT barato → verificar → escalar· relatar um problema →
UM cascata de modelo corre um modelo barato primeiro, verifica a resposta e apenas aumenta aqueles que falha em um modelo premium — o padrão FrugalGPT. Mas você paga o modelo barato em todo solicitação, além de um verificador, mais prêmio sobre a parcela escalada – portanto, não é gratuito. Isso precifica o real misturado custo mensal de uma cascata contra sempre premium e uma divisão simples, e encontra o taxa de escalonamento onde a cascata para de salvar.
O verificador é executado em todas as solicitações, não apenas nas escalações.
—
cascata / mês
—sempre premium / mês
—poupança
—escalada do ponto de equilíbrio
De onde vem o custo em cascata
O modelo barato e o verificador são pagos integralmente; o modelo premium é pago apenas sobre a parcela escalonada. Sempre premium e uma divisão de tráfego simples são mostradas para comparação.
Componente
Custo mensal
Compartilhar
Economia nas taxas de escalonamento
A taxa de escalada é o fator de oscilação. Isso mantém todo o resto fixo e mostra onde a cascata para de superar o sempre premium – a linha do ponto de equilíbrio é marcada.
Escalada
Cascata / mês
Poupança
Veredicto
Um modelo barato primeiro não é uma conta barata por padrão
O apelo de uma cascata é óbvio: a maioria das solicitações é fácil, um modelo pequeno as atende corretamente e pagar preços premium por um trabalho fácil é um desperdício. Execute primeiro o modelo barato, mantenha as respostas que passam na verificação e escale apenas as que falham – o resultado do FrugalGPT mostrou que isso pode corresponder à qualidade de um modelo de fronteira por uma fração do custo. A armadilha é tratar o modelo barato como o custo total. Você paga em cada solicitação, independentemente de a resposta sobreviver ou não. Você também paga um verificador em cada solicitação, porque algo precisa decidir o que será escalado, e esse algo geralmente é outra chamada de modelo. E na parcela que você escalar, você paga o modelo premium além da tentativa barata que você já fez. Some tudo isso e o quadro muda: a cascata economiza bastante quando o escalonamento é baixo, diminui à medida que o escalonamento aumenta e, além de uma taxa de equilíbrio, custa mais do que apenas chamar o modelo premium em tudo - porque você pagou o modelo barato e o verificador de graça e ainda pagou o preço premium integral. Esta calculadora avalia todas as três etapas a partir de suas próprias contagens e taxas de tokens, compara a cascata com sempre premium e com uma divisão de tráfego simples que nunca paga duas vezes e marca a taxa de escalonamento onde a aritmética muda. Se você encaminhar cada solicitação para um único modelo antecipadamente, em vez de escalar, avalie isso com o calculadora de roteador modelo; para empilhar cache, lote e outras alavancas no topo, use o calculadora de otimização de custos; e para comparar os dois modelos, consulte o comparação de modelos.
Começa com o custo por solicitação de cada modelo: tokens de entrada vezes o preço de entrada mais tokens de saída vezes o preço de saída, dividido por um milhão. O modelo barato e o verificador são cobrados pelo volume total de solicitações, portanto, seu custo mensal é o valor por solicitação vezes as solicitações por mês. O modelo premium é cobrado apenas no compartilhamento escalado, portanto, seu custo mensal é o custo premium por solicitação vezes as solicitações vezes a taxa de escalação. O custo mensal em cascata é a soma dos três. Always-premium é simplesmente o custo premium por solicitação multiplicado pelo volume total; a divisão de tráfego simples — mostrada para comparação — paga o modelo barato sobre a parcela não escalonada e o modelo premium sobre a parcela escalonada, nunca ambos. A economia é uma cascata negativa em relação ao prêmio sempre. A taxa de escalonamento do ponto de equilíbrio é um menos a proporção entre o custo barato mais verificador por solicitação e o custo premium por solicitação: abaixo dela, a cascata supera o sempre premium, acima dela, a primeira tentativa barata mais o verificador é um peso morto e ir direto para o premium é mais barato. O modelo pressupõe que as solicitações escalonadas usam as mesmas contagens de tokens em ambos os modelos; se suas chamadas premium forem mais longas, aumente a contagem de tokens premium para refletir isso.
Perguntas frequentes
O que é uma cascata LLM e como ela economiza dinheiro?
Ele responde a cada solicitação com o modelo mais barato que pode lidar com isso: um modelo barato é executado primeiro, um verificador decide se a resposta é boa o suficiente e apenas as falhas escalam para um modelo premium. Most requests are easy, so the cheap model clears them at a fraction of the cost. The saving is real, but you still pay the cheap model and verifier on every request plus premium on the escalated share.
Qual a diferença entre uma cascata e o roteamento entre dois modelos?
Um roteador escolhe um modelo antecipadamente, de modo que cada solicitação paga por um modelo e nunca paga duas vezes – mas um desvio de rota envia uma resposta errada. Uma cascata executa o modelo barato em tudo e aumenta as falhas, de modo que as solicitações escaladas pagam barato mais verificador mais premium, mas cada solicitação difícil recebe uma segunda tentativa adequada. Esta ferramenta mostra ambos os custos com a mesma taxa de escalonamento.
A que taxa de escalonamento uma cascata para de salvar?
Na taxa de escalonamento do ponto de equilíbrio - um menos a proporção entre o custo por solicitação barato mais verificador e o custo premium por solicitação. Abaixo dela, a cascata bate sempre premium; acima disso, você pagou o modelo barato e o verificador com poucos benefícios e ainda pagou o prêmio integral, portanto, ligar diretamente para o premium é mais barato. Quanto mais barato for o seu pequeno modelo e verificador, maior será a escalada antes que a cascata se transforme em perda.
O que conta como custo do verificador e por que isso é importante?
O verificador é tudo o que decide enviar ou escalar – um modelo de juiz pequeno, uma aprovação de autoconsistência ou um limite de incorporação – e é executado em cada solicitação, portanto, um custo por chamada que parece trivial aumenta em volume. Ele também estabelece o padrão: mesmo com escalonamento zero, você paga o modelo barato mais o verificador por todo o volume. Esta calculadora trata-a como uma entrada de primeira classe em vez de arredondá-la para zero.