Tarification de la passerelle
—
frais généraux de passerelle / mois—total de la passerelle
—balisage efficace
—frais généraux / an
Frais généraux à mesure que vous évoluez
Un forfait diminue en proportion de la facture avec le volume ; une majoration en pourcentage augmente en même temps. Regardez où les frais généraux croisent le coût de gestion de votre propre proxy.
| Demandes mensuelles | Coût direct | Total de la passerelle | Aérien |
|---|
La couche commodité a un prix qui évolue avec vous
Une passerelle LLM achète des choses réelles – une API chez de nombreux fournisseurs, un repli automatique lorsqu'un modèle est en panne, une mise en cache, une journalisation et des limites de dépenses centralisées – et les facture sous la forme d'un pourcentage de majoration sur les jetons, de frais par demande, de frais de plate-forme mensuels fixes ou d'un mélange. Le piège est qu'un pourcentage de majoration est invisible lorsque vous êtes petit et énorme lorsque vous êtes grand : 5 % sur une facture de 200 $ est une erreur d'arrondi, mais 5 % sur une facture de 40 000 $ représente le salaire annuel d'un ingénieur à temps plein, dépensé pour une fonctionnalité que vous pourriez auto-héberger avec un proxy open source. Ce calculateur sépare le coût brut du fournisseur de la réduction de la passerelle afin que vous puissiez voir la majoration effective et les frais généraux annuels en un seul endroit, puis décider itinéraire par itinéraire. Comparez les prix bruts des jetons sur le comparaison de prix des modèles, récupérez les dépenses liées aux invites répétées avec mise en cache rapide, et modéliser l'ensemble de la facture sur le Calculateur du coût de la pile API.
Coût du substrat rocheuxCoût de migration du modèlePlanificateur de budget APICoût de la fenêtre contextuelleCoût du chatbot RAG
Comment fonctionne cette calculatrice
Le Calculateur de balisage AI Gateway calcule le coût mensuel total du routage de votre trafic LLM via une passerelle ou un routeur de revendeur tel qu'OpenRouter, Portkey, Helicone ou LiteLLM cloud, et sépare ce total entre le coût du fournisseur sous-jacent et le supplément que vous payez pour la passerelle en plus. Cela commence par votre demandes mensuelles multiplié par le jetons d'entrée et de sortie par requête, évalue ces jetons chez le fournisseur taux d'entrée et de sortie par million, puis des couches sur les trois façons dont les passerelles ajoutent des coûts : a majoration en pourcentage appliqué à la dépense symbolique, un frais par demande qui évolue avec le volume d'appels, et un frais de plateforme forfaitaires facturé chaque mois. Les principaux facteurs déterminants sont le volume de vos demandes et le nombre moyen de jetons, car ceux-ci définissent les dépenses de base sur lesquelles chaque pourcentage et chaque frais par demande sont calculés.
Le principal compromis à surveiller est le comportement de chaque type de frais à mesure que vous évoluez. UN majoration en pourcentage augmente en proportion directe de vos dépenses en jetons, il devient donc le coût dominant pour les charges de travail à jetons ou à volume élevé, tandis qu'un frais par demande cela fait le plus mal lorsque vous envoyez de nombreux petits appels avec quelques jetons chacun. UN frais de plateforme forfaitaires est le contraire : cela n'a guère d'importance en cas de volume élevé, mais peut constituer l'élément de campagne le plus important pour un petit projet. Un conseil pratique consiste à saisir votre trafic réaliste, puis à comparer le coût supplémentaire de la passerelle avec ce que vous paieriez directement au fournisseur, car les fonctionnalités de commodité, de routage et d'observabilité offertes par une passerelle n'en valent la peine que si la majoration reste faible par rapport à vos dépenses de base.
Questions fréquemment posées
Que facture réellement une passerelle IA ?
Une passerelle IA ou un routeur LLM se situe entre votre application et les fournisseurs de modèles, vous offrant une API pour de nombreux modèles, un repli automatique, une mise en cache, une journalisation et des contrôles des dépenses. Il paie cela en ajoutant le coût de l'une des trois manières suivantes : une majoration en pourcentage sur le prix du jeton sous-jacent, un montant forfaitaire par demande ou un abonnement mensuel à la plateforme – et certains combinent les trois. Une majoration en pourcentage pur s'adapte directement à vos dépenses en jetons, de sorte qu'elle reste bon marché sur un trafic léger mais augmente sans limite à mesure que vous évoluez. Des frais par requête punissent un nombre élevé de requêtes avec de petites charges utiles. Un forfait mensuel est fixé quel que soit le volume, il est donc cher lorsque l'on est petit et négligeable une fois que l'on est grand. Cette calculatrice additionne selon les cas et affiche les frais généraux réels.
Une majoration de passerelle vaut-elle la peine d'être payée ?
Cela dépend de ce que vous rapportent les frais généraux et de leur importance. Sur un faible volume, une majoration de quelques pour cent est insignifiante et la fiabilité, la facturation unifiée et le changement instantané de modèle en valent facilement la peine. À grande échelle, le même pourcentage peut atteindre des milliers de dollars par mois, auquel cas l'auto-hébergement d'un proxy open source tel que LiteLLM et les appels directs des fournisseurs payent souvent plusieurs fois le temps d'un ingénieur. La décision dépend du balisage efficace rapporté par cet outil : comparez ce chiffre annuel au coût d'ingénierie lié à l'exécution de votre propre routage et de votre mise en cache.
Comment puis-je réduire les frais généraux de la passerelle sans perdre les fonctionnalités ?
Acheminez uniquement le trafic qui a besoin des fonctionnalités de la passerelle et envoyez des appels stables et à grand volume directement au fournisseur. Activez la mise en cache afin que les invites répétées n’atteignent jamais le chemin mesuré. Surveillez les passerelles qui balisent les jetons mis en cache au tarif plein. Et une fois que vos frais généraux basés sur un pourcentage dépassent le coût d'un proxy open source auto-hébergé, migrez les routes lourdes hors de la passerelle payante tout en les conservant pour la longue traîne de modèles que vous appelez rarement. Le tableau des frais généraux cumulés ci-dessous montre exactement quand ce croisement vaut l'effort de migration.