Chaque couche analyse chaque demande indépendamment. Contrairement à la tarification LLM basée sur des jetons, la plupart des API de garde-corps facturent par élément vérifié – de sorte que la facture évolue en fonction du volume de demandes, et non en fonction du coût de l'appel du modèle sous-jacent lui-même. C'est pourquoi une pile de couches payantes peut finir par coûter plus cher que les dépenses en jetons d'un modèle rapide et bon marché.
—
pile de garde-corps / mois
—par demande
—taxe de sécurité (% des dépenses LLM)
—calques actifs
Coût par niveau, même volume
Même volume de requêtes et même sélection de couches, trois niveaux de tarifs.
| Étage | Coût du garde-corps / mois | Taxe de sécurité |
|---|
⚠️ Estimation à l'aide de tarifs de référence représentatifs (juillet 2026), et non des prix en direct du fournisseur : les grilles tarifaires varient selon le fournisseur, le type d'article (texte, image ou vidéo) et les remises sur volume. Le niveau prototype suppose des modèles gratuits/auto-hébergés (point de terminaison de modération OpenAI, Llama Guard sur votre propre ordinateur) à un coût marginal proche de 0 $. Confirmez les prix actuels auprès du fournisseur de votre choix avant de vous engager. ·
Signaler un prix obsolète →
Pourquoi « ajouter un appel de modération » sous-estime le coût réel
La plupart de la planification des coûts pour une fonctionnalité LLM commence et se termine au prix symbolique du modèle. Un système de production qui parle aux utilisateurs réels n'est presque jamais livré avec un seul appel - il ajoute une modération des entrées pour détecter les mauvaises invites avant qu'elles n'atteignent le modèle, une modération des sorties pour détecter les mauvaises achèvements avant qu'elles n'atteignent l'utilisateur, et de plus en plus de rédaction de PII et de détection d'injection d'invites à mesure que les agents acquièrent des capacités d'appel d'outils et de traitement de documents. Chacun d'entre eux est un appel API distinct, tarifé par article plutôt que par jeton, et chacun s'exécute sur chaque demande, quel que soit le degré de brièveté ou de faible coût de l'appel du modèle sous-jacent. À volume élevé avec un modèle rapide et bon marché, la pile de garde-corps peut devenir l'élément le plus important de la facture, et non le LLM.
Le cadrage de la « taxe de sécurité »
Exprimer le coût du garde-corps en pourcentage des dépenses LLM – la taxe de sécurité – rend le compromis lisible, contrairement à un chiffre brut. Une équipe qui gère des dépenses de classe GPT-4o peut absorber quelques centaines de dollars de modération sans s'en rendre compte ; la même facture de garde-fou à côté d’un cas d’utilisation de modèle bon marché et à grand volume (triage du support client sur un petit modèle rapide, par exemple) peut éclipser le coût du modèle plusieurs fois. Ce n'est pas une raison pour ignorer les garde-fous : c'est une raison pour dimensionner la pile en fonction de la surface de risque réelle au lieu d'exécuter chaque couche sur chaque requête par défaut.
Où sont les vraies économies
Deux leviers sont plus importants que le choix d'un fournisseur moins cher : pré-filtrer avec des heuristiques gratuites (listes de mots clés/regex, recherches de hachages incorrects) afin que seul le contenu ambigu atteigne l'API payante, et être honnête sur les couches dont votre produit a réellement besoin - voir la FAQ ci-dessus. L'auto-hébergement d'un modèle de garde-corps ouvert comme Llama Guard 3 ou Granite Guardian supprime entièrement les frais par article en échange de la possession d'une infrastructure d'inférence, qui constitue généralement le meilleur échange une fois que le volume est élevé et stable. Pour la couche de modération tarifée seule, consultez le calculateur de coût de modération de contenu; pour les dépenses d'évaluation/red-teaming plutôt que le filtrage de la production, voir le Calculateur de coût d'évaluation LLM.
Coût de modération du contenuCoût d'évaluation LLMCalculateur du coût des agents IACalculateur du coût de la pile APIGarde-corps : auto-hébergé ou géréCoût de vérification KYC et ID
Comment fonctionne cette calculatrice
Le Calculateur du coût de la pile AI Guardrails estime le coût mensuel réel de fonctionnement d'une couche de sécurité LLM de production - modération des entrées, modération des sorties, rédaction des informations personnelles et détection des injections rapides – sous la forme d’un ensemble combiné plutôt que de quatre éléments de campagne distincts. Cela multiplie votre demandes par mois par le coût par chèque impliqué par votre sélection niveau de taux, puis exprime le total par rapport à votre dépenses LLM actuelles pour montrer le taxe de sécurité: le pourcentage du budget de votre modèle que les garde-corps ajoutent en plus. Les principaux facteurs déterminants sont le volume des demandes, le nombre de chèques sur les quatre que vous empilez et le niveau auquel vous êtes admissible, car un volume plus élevé modifie généralement les prix unitaires.
Le principal compromis à surveiller est couverture par rapport aux frais généraux. Le filtrage des entrées et des sorties double à peu près les appels de garde-fou, et chaque vérification ajoute de la latence ainsi que du coût, de sorte qu'une pile peut tranquillement rivaliser avec les dépenses de modèle qu'elle protège. Utilisez la calculatrice pour vérifier si chaque couche mérite sa place : certaines charges de travail justifient une modération complète plus la rédaction des informations personnelles, tandis que le trafic interne à faible risque peut s'exécuter en toute sécurité. saisie uniquement chèques. Réexécutez-le chaque fois que le volume de requêtes dépasse une limite de niveau, car le pourcentage de la taxe de sécurité peut varier considérablement même lorsque l'utilisation de votre modèle sous-jacent reste stable.
Questions fréquemment posées
Pourquoi une pile de sécurité coûterait-elle plus cher que ce que le LLM lui-même appelle ?
Parce que chaque couche de garde-corps analyse le même texte indépendamment et est facturée par article, et non par jeton – et une configuration de production exécute souvent plusieurs couches (modération d'entrée, modération de sortie, rédaction de PII, détection d'injection rapide) sur chaque demande. En cas de volume de requêtes élevé avec un modèle sous-jacent bon marché, les frais de garde par requête peuvent s'élever à plus que le coût du jeton par requête d'un modèle petit/rapide, en particulier une fois que vous avez dépassé les niveaux gratuits comme le point de terminaison de modération d'OpenAI et que vous êtes entré dans des plateformes tierces payantes.
Ai-je besoin des quatre couches de garde-corps ?
Non, cela dépend de ce que vous construisez. Un outil interne simple doté d’utilisateurs fiables et authentifiés peut souvent ignorer entièrement la détection d’injection rapide et la rédaction des informations personnelles et s’appuyer uniquement sur la modération des entrées et sorties. Un agent orienté client qui peut effectuer des actions (appels d'outils, achats, modifications de compte) ou qui traite les documents soumis par l'utilisateur est l'endroit où la détection des injections et la gestion des informations personnelles cessent d'être facultatives. Désactivez chaque couche ci-dessous pour voir ce que vous payez réellement pour celles dont vous n'avez pas besoin.
Les modèles de garde-corps auto-hébergés sont-ils moins chers qu’une API ?
Souvent oui, à grande échelle : les modèles ouverts comme Llama Guard 3 ou IBM Granite Guardian peuvent fonctionner sur votre propre GPU ou sur un point de terminaison d'inférence partagé pour un coût proche du calcul uniquement, sans frais par article. Le compromis est le même que pour l'auto-hébergement de n'importe quel modèle : vous possédez la disponibilité, le réglage de la latence et le maintien du modèle à jour contre les nouveaux modèles d'attaque, par rapport à une API gérée dont le prix est facturé par article mais qui gère cette maintenance pour vous.