Preços de gateway
—
sobrecarga de gateway / mês—total de gateway
—marcação eficaz
—despesas gerais / ano
Sobrecarga conforme você escala
Uma taxa fixa diminui em proporção à conta com o volume; uma margem percentual cresce junto com ela. Observe onde a sobrecarga ultrapassa o custo de execução do seu próprio proxy.
| Solicitações mensais | Custo direto | Total de gateway | Despesas gerais |
|---|
A camada de conveniência tem um preço que varia com você
Um gateway LLM compra coisas reais – uma API em muitos provedores, fallback automático quando um modelo está inativo, cache, registro e limites de gastos centralizados – e cobra por eles como uma margem percentual sobre tokens, uma taxa por solicitação, uma taxa fixa mensal de plataforma ou uma combinação. A armadilha é que uma margem percentual é invisível quando você é pequeno e enorme quando você é grande: 5% em uma nota de US$ 200 é um erro de arredondamento, mas 5% em uma nota de US$ 40 mil é o salário anual de um engenheiro em tempo integral, gasto em um recurso que você poderia auto-hospedar com um proxy de código aberto. Esta calculadora separa o custo bruto do provedor do corte do gateway para que você possa ver a marcação efetiva e a sobrecarga anual em um só lugar e, em seguida, decidir rota por rota. Compare os preços brutos dos tokens no comparação de preços de modelos, recupere gastos com solicitações repetidas com cache de prompte modelar toda a conta no Calculadora de custos de pilha de API.
Custo da base rochosaCusto de migração de modeloPlanejador de orçamento de APICusto da janela de contextoCusto do chatbot RAG
Como funciona esta calculadora
O Calculadora de marcação do AI Gateway calcula o custo mensal total de roteamento de seu tráfego LLM por meio de um gateway de revendedor ou roteador, como OpenRouter, Portkey, Helicone ou nuvem LiteLLM, e separa esse total no custo do provedor subjacente e no extra que você paga ao gateway. Começa a partir do seu solicitações mensais multiplicado pelo tokens de entrada e saída por solicitação, precifica esses tokens no preço do provedor taxas de entrada e saída por milhãoe, em seguida, aborda as três maneiras pelas quais os gateways adicionam custos: um marcação percentual aplicado ao gasto de token, um taxa por solicitação que aumenta com o volume da chamada e um taxa fixa de plataforma cobrado a cada mês. Os principais motivadores são o volume de solicitações e a contagem média de tokens, uma vez que eles definem o gasto base com o qual cada porcentagem e cobrança por solicitação é calculada.
A principal compensação a ser observada é como cada tipo de taxa se comporta conforme você aumenta. UM marcação percentual cresce em proporção direta ao seu gasto com tokens, tornando-se o custo dominante para cargas de trabalho de alto volume ou de tokens altos, enquanto um taxa por solicitação dói mais quando você envia muitas chamadas pequenas com poucos tokens cada. UM taxa fixa de plataforma é o oposto: pouco importa em grandes volumes, mas pode ser o maior item de linha para um projeto pequeno. Uma dica prática é inserir seu tráfego realista e, em seguida, comparar o custo adicional do gateway com o que você pagaria diretamente ao provedor, uma vez que os recursos de conveniência, roteamento e observabilidade que um gateway oferece só valem a pena se a marcação permanecer pequena em relação ao seu gasto base.
Perguntas frequentes
Quanto é que um gateway de IA realmente cobra?
Um gateway AI ou roteador LLM fica entre seu aplicativo e os provedores de modelo, fornecendo uma API para muitos modelos, fallback automático, armazenamento em cache, registro e controles de gastos. Ele paga isso adicionando custos de uma das três maneiras: uma margem percentual sobre o preço do token subjacente, uma taxa fixa por solicitação ou uma assinatura mensal da plataforma – e alguns combinam todos os três. Uma marcação percentual pura é dimensionada diretamente com o gasto do token, de modo que permanece barata no tráfego leve, mas cresce sem limites à medida que você aumenta. Uma taxa por solicitação pune altas contagens de solicitações com pequenas cargas úteis. Uma taxa mensal fixa é fixa independentemente do volume, por isso é cara quando você é pequeno e insignificante quando você é grande. Esta calculadora soma o que for aplicável e mostra a sobrecarga real.
Vale a pena pagar uma marcação de gateway?
Depende de quanto você compra com as despesas gerais e de quão grande ela é. Em volumes baixos, uma margem de lucro de alguns por cento é trivial e a confiabilidade, o faturamento unificado e a troca instantânea de modelo valem facilmente a pena. Em escala, a mesma porcentagem pode chegar a milhares de dólares por mês, ponto em que a auto-hospedagem de um proxy de código aberto, como o LiteLLM, e os provedores de chamadas diretamente muitas vezes pagam muitas vezes mais pelo tempo de um engenheiro. A decisão depende da marcação eficaz que esta ferramenta reporta: compare esse valor anual com o custo de engenharia de execução do seu próprio roteamento e cache.
Como faço para reduzir a sobrecarga do gateway sem perder os recursos?
Roteie apenas o tráfego que precisa dos recursos do gateway por meio dele e envie chamadas estáveis e de alto volume diretamente para o provedor. Ative o cache para que prompts repetidos nunca alcancem o caminho medido. Fique atento aos gateways que marcam os tokens armazenados em cache na taxa total. E uma vez que sua sobrecarga baseada em porcentagem ultrapassa o custo de um proxy de código aberto auto-hospedado, migre as rotas pesadas do gateway pago, mantendo-o para a longa cauda de modelos que você raramente chama. A tabela de sobrecarga cumulativa abaixo mostra exatamente quando esse cruzamento vale o esforço de migração.