Quanto custa cada taxa substituta
Os mesmos tokens, o mesmo tráfego – apenas a taxa de acionamento primário→fallback muda.
| Taxa de reserva | Custo mensal | Despesas gerais vs primárias | % de despesas gerais |
|---|
O custo oculto do seu nível de confiabilidade
Uma cadeia de fallback de modelo é o padrão de gateway AI 2026: envie a solicitação para um modelo primário rápido e barato; se essa chamada tiver taxa limitada ou erros, o gateway (OpenRouter, Portkey, LiteLLM ou um wrapper personalizado) tentará automaticamente contra um modelo de fallback mais caro e confiável e, às vezes, um terceiro nível se o fallback também falhar. É a arquitetura certa para o tempo de atividade – mas o nível de fallback geralmente custa de 5 a 20 vezes o preço principal por token, precisamente porque o primário foi escolhido por ser barato. Uma taxa de reserva que parece insignificante em um painel – 5%, até 2% – pode movimentar a conta muito mais do que essa porcentagem sugere.
A matemática não é linear porque os dois níveis não têm o mesmo preço. Custo combinado por solicitação = custo_primário × (1 − p1) + custo_de fallback × p1 × (1 − p2) + custo_terciário × p1 × p2, onde p1 é a taxa de acionamento do primário para substituto e p2 é a (muito mais rara) taxa de retorno para o terciário. Com uma diferença de preço de 14× entre os níveis, uma taxa de reserva de 5% pode adicionar 50-65% à conta combinada, mesmo que 95% das solicitações ainda atinjam o primário barato – porque esses 5% do tráfego estão pagando mais da metade do custo total em dólares.
Esta é uma forma de custo genuinamente diferente da roteamento de modelo deliberado (onde você escolhe a divisão barato/caro por design) ou um método simples nova tentativa em caso de falha custo (onde o mesmo modelo tenta novamente). Aqui, a meta de escalonamento é um modelo diferente e mais caro, e é acionado pelas condições da infraestrutura – capacidade, limites de taxas – e não pela dificuldade da tarefa.
Relacionado: economia de roteamento de modelo, Custo de nova tentativa de API, Custo de migração do fornecedor LLM, orçamento de loop de agente.
Como usar
1. Escolha uma cadeia predefinida ou insira seus próprios preços por milhão para os níveis primário, substituto e terciário.
2. Insira solicitações mensais e tokens de entrada/saída típicos por solicitação.
3. Defina suas taxas de acionamento primárias → substitutas e substitutas → terciárias observadas (ou estimadas).
4. Leia o custo mensal combinado e as despesas gerais em comparação com uma linha de base primária pura; use a tabela para ver quão sensível é sua fatura à taxa de reserva.
Erros comuns
Supondo que o custo de reserva seja escalonado com a taxa de reserva. Isso não acontece – ele é dimensionado com a taxa de reserva multiplicada pela relação de preços entre os níveis, que geralmente é muito maior. Ignorando o nível terciário. Se o seu substituto também falhar sob carga sustentada, o nível terciário (se houver) geralmente custa o mesmo que o substituto, mas adiciona risco de latência – modele-o mesmo com uma taxa baixa. Faturamento de chamadas falhadas. A maioria dos provedores não cobra pela rejeição do limite de taxa rígido; se o seu acontecer (geração parcial antes de um erro intermediário), sua sobrecarga real será maior que essa estimativa. Buscando 100% de tempo de atividade com o substituto mais caro. Um substituto de nível intermediário geralmente recupera a maior parte da confiabilidade por uma fração do custo de pular direto para o modelo principal.
Perguntas frequentes
O que é uma cadeia alternativa de modelo de IA?
Um padrão de gateway em que uma solicitação com falha ou com taxa limitada é repetida automaticamente em um modelo de backup e, opcionalmente, em uma terceira camada, se isso também falhar. Usado por OpenRouter, Portkey, LiteLLM e ferramentas similares.
Por que uma pequena taxa de reserva custa tanto?
Os modelos substitutos geralmente têm preços muito acima do preço primário por token. Mesmo uma taxa de acionamento de 5% pode adicionar mais de 50% à conta se o substituto custar de 10 a 14 vezes mais por solicitação.
As solicitações rejeitadas são cobradas?
Prática padrão: uma rejeição de limite de taxa 429 fatura US$ 0, uma vez que nenhum token foi gerado. Esta calculadora assume essa convenção.
Como posso reduzir a taxa de fallback de forma barata?
Aumente o limite de taxa do seu nível primário, adicione espera e nova tentativa no primário antes de escalar, distribua o tráfego entre chaves/provedores ou insira um substituto de nível intermediário em vez de pular direto para o modelo mais caro.
Estimativa apenas. Os preços dos modelos são valores de referência e mudam frequentemente – verifique os preços atuais com cada fornecedor.