Chaque couche analyse chaque demande indépendamment. Contrairement à la tarification LLM basée sur des jetons, la plupart des API de garde-corps facturent par élément vérifié – de sorte que la facture évolue en fonction du volume de demandes, et non en fonction du coût de l'appel du modèle sous-jacent lui-même. C'est pourquoi une pile de couches payantes peut finir par coûter plus cher que les dépenses en jetons d'un modèle rapide et bon marché.

pile de garde-corps / mois
par demande
taxe de sécurité (% des dépenses LLM)
calques actifs

Coût par niveau, même volume

Même volume de requêtes et même sélection de couches, trois niveaux de tarifs.

ÉtageCoût du garde-corps / moisTaxe de sécurité
⚠️ Estimation à l'aide de tarifs de référence représentatifs (juillet 2026), et non des prix en direct du fournisseur : les grilles tarifaires varient selon le fournisseur, le type d'article (texte, image ou vidéo) et les remises sur volume. Le niveau prototype suppose des modèles gratuits/auto-hébergés (point de terminaison de modération OpenAI, Llama Guard sur votre propre ordinateur) à un coût marginal proche de 0 $. Confirmez les prix actuels auprès du fournisseur de votre choix avant de vous engager. · Signaler un prix obsolète →

Pourquoi « ajouter un appel de modération » sous-estime le coût réel

La plupart de la planification des coûts pour une fonctionnalité LLM commence et se termine au prix symbolique du modèle. Un système de production qui parle aux utilisateurs réels n'est presque jamais livré avec un seul appel - il ajoute une modération des entrées pour détecter les mauvaises invites avant qu'elles n'atteignent le modèle, une modération des sorties pour détecter les mauvaises achèvements avant qu'elles n'atteignent l'utilisateur, et de plus en plus de rédaction de PII et de détection d'injection d'invites à mesure que les agents acquièrent des capacités d'appel d'outils et de traitement de documents. Chacun d'entre eux est un appel API distinct, tarifé par article plutôt que par jeton, et chacun s'exécute sur chaque demande, quel que soit le degré de brièveté ou de faible coût de l'appel du modèle sous-jacent. À volume élevé avec un modèle rapide et bon marché, la pile de garde-corps peut devenir l'élément le plus important de la facture, et non le LLM.

Le cadrage de la « taxe de sécurité »

Exprimer le coût du garde-corps en pourcentage des dépenses LLM – la taxe de sécurité – rend le compromis lisible, contrairement à un chiffre brut. Une équipe qui gère des dépenses de classe GPT-4o peut absorber quelques centaines de dollars de modération sans s'en rendre compte ; la même facture de garde-fou à côté d’un cas d’utilisation de modèle bon marché et à grand volume (triage du support client sur un petit modèle rapide, par exemple) peut éclipser le coût du modèle plusieurs fois. Ce n'est pas une raison pour ignorer les garde-fous : c'est une raison pour dimensionner la pile en fonction de la surface de risque réelle au lieu d'exécuter chaque couche sur chaque requête par défaut.

Où sont les vraies économies

Deux leviers sont plus importants que le choix d'un fournisseur moins cher : pré-filtrer avec des heuristiques gratuites (listes de mots clés/regex, recherches de hachages incorrects) afin que seul le contenu ambigu atteigne l'API payante, et être honnête sur les couches dont votre produit a réellement besoin - voir la FAQ ci-dessus. L'auto-hébergement d'un modèle de garde-corps ouvert comme Llama Guard 3 ou Granite Guardian supprime entièrement les frais par article en échange de la possession d'une infrastructure d'inférence, qui constitue généralement le meilleur échange une fois que le volume est élevé et stable. Pour la couche de modération tarifée seule, consultez le calculateur de coût de modération de contenu; pour les dépenses d'évaluation/red-teaming plutôt que le filtrage de la production, voir le Calculateur de coût d'évaluation LLM.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Coût de modération du contenuCoût d'évaluation LLMCalculateur du coût des agents IACalculateur du coût de la pile API