Preços de gateway
—
sobrecarga de gateway / mês—total de gateway
—marcação eficaz
—despesas gerais / ano
Sobrecarga conforme você escala
Uma taxa fixa diminui em proporção à conta com o volume; uma margem percentual cresce junto com ela. Observe onde a sobrecarga ultrapassa o custo de execução do seu próprio proxy.
| Solicitações mensais | Custo direto | Total de gateway | Despesas gerais |
|---|
A camada de conveniência tem um preço que varia com você
Um gateway LLM compra coisas reais – uma API em muitos provedores, fallback automático quando um modelo está inativo, cache, registro e limites de gastos centralizados – e cobra por eles como uma margem percentual sobre tokens, uma taxa por solicitação, uma taxa fixa mensal de plataforma ou uma combinação. A armadilha é que uma margem percentual é invisível quando você é pequeno e enorme quando você é grande: 5% em uma nota de US$ 200 é um erro de arredondamento, mas 5% em uma nota de US$ 40 mil é o salário anual de um engenheiro em tempo integral, gasto em um recurso que você poderia auto-hospedar com um proxy de código aberto. Esta calculadora separa o custo bruto do provedor do corte do gateway para que você possa ver a marcação efetiva e a sobrecarga anual em um só lugar e, em seguida, decidir rota por rota. Compare os preços brutos dos tokens no comparação de preços de modelos, recupere gastos com solicitações repetidas com cache de prompte modelar toda a conta no Calculadora de custos de pilha de API.
Custo da base rochosaCusto de migração de modeloPlanejador de orçamento de APICusto da janela de contextoCusto do chatbot RAG
Como funciona esta calculadora
Calculadora gratuita de marcação de gateway AI. Roteadores LLM e gateways de revendedor (OpenRouter, Portkey, Helicone, nuvem LiteLLM) adicionam uma marcação percentual, uma taxa por solicitação…
Perguntas frequentes
Quanto é que um gateway de IA realmente cobra?
Um gateway AI ou roteador LLM fica entre seu aplicativo e os provedores de modelo, fornecendo uma API para muitos modelos, fallback automático, armazenamento em cache, registro e controles de gastos. Ele paga isso adicionando custos de uma das três maneiras: uma margem percentual sobre o preço do token subjacente, uma taxa fixa por solicitação ou uma assinatura mensal da plataforma – e alguns combinam todos os três. Uma marcação percentual pura é dimensionada diretamente com o gasto do token, de modo que permanece barata no tráfego leve, mas cresce sem limites à medida que você aumenta. Uma taxa por solicitação pune altas contagens de solicitações com pequenas cargas úteis. Uma taxa mensal fixa é fixa independentemente do volume, por isso é cara quando você é pequeno e insignificante quando você é grande. Esta calculadora soma o que for aplicável e mostra a sobrecarga real.
Vale a pena pagar uma marcação de gateway?
Depende de quanto você compra com as despesas gerais e de quão grande ela é. Em volumes baixos, uma margem de lucro de alguns por cento é trivial e a confiabilidade, o faturamento unificado e a troca instantânea de modelo valem facilmente a pena. Em escala, a mesma porcentagem pode chegar a milhares de dólares por mês, ponto em que a auto-hospedagem de um proxy de código aberto, como o LiteLLM, e os provedores de chamadas diretamente muitas vezes pagam muitas vezes mais pelo tempo de um engenheiro. A decisão depende da marcação eficaz que esta ferramenta reporta: compare esse valor anual com o custo de engenharia de execução do seu próprio roteamento e cache.
Como faço para reduzir a sobrecarga do gateway sem perder os recursos?
Roteie apenas o tráfego que precisa dos recursos do gateway por meio dele e envie chamadas estáveis e de alto volume diretamente para o provedor. Ative o cache para que prompts repetidos nunca alcancem o caminho medido. Fique atento aos gateways que marcam os tokens armazenados em cache na taxa total. E uma vez que sua sobrecarga baseada em porcentagem ultrapassa o custo de um proxy de código aberto auto-hospedado, migre as rotas pesadas do gateway pago, mantendo-o para a longa cauda de modelos que você raramente chama. A tabela de sobrecarga cumulativa abaixo mostra exatamente quando esse cruzamento vale o esforço de migração.