Chaque couche analyse chaque demande indépendamment. Contrairement à la tarification LLM basée sur des jetons, la plupart des API de garde-corps facturent par élément vérifié – de sorte que la facture évolue en fonction du volume de demandes, et non en fonction du coût de l'appel du modèle sous-jacent lui-même. C'est pourquoi une pile de couches payantes peut finir par coûter plus cher que les dépenses en jetons d'un modèle rapide et bon marché.
Coût par niveau, même volume
Même volume de requêtes et même sélection de couches, trois niveaux de tarifs.
| Étage | Coût du garde-corps / mois | Taxe de sécurité |
|---|
Pourquoi « ajouter un appel de modération » sous-estime le coût réel
La plupart de la planification des coûts pour une fonctionnalité LLM commence et se termine au prix symbolique du modèle. Un système de production qui parle aux utilisateurs réels n'est presque jamais livré avec un seul appel - il ajoute une modération des entrées pour détecter les mauvaises invites avant qu'elles n'atteignent le modèle, une modération des sorties pour détecter les mauvaises achèvements avant qu'elles n'atteignent l'utilisateur, et de plus en plus de rédaction de PII et de détection d'injection d'invites à mesure que les agents acquièrent des capacités d'appel d'outils et de traitement de documents. Chacun d'entre eux est un appel API distinct, tarifé par article plutôt que par jeton, et chacun s'exécute sur chaque demande, quel que soit le degré de brièveté ou de faible coût de l'appel du modèle sous-jacent. À volume élevé avec un modèle rapide et bon marché, la pile de garde-corps peut devenir l'élément le plus important de la facture, et non le LLM.
Le cadrage de la « taxe de sécurité »
Exprimer le coût du garde-corps en pourcentage des dépenses LLM – la taxe de sécurité – rend le compromis lisible, contrairement à un chiffre brut. Une équipe qui gère des dépenses de classe GPT-4o peut absorber quelques centaines de dollars de modération sans s'en rendre compte ; la même facture de garde-fou à côté d’un cas d’utilisation de modèle bon marché et à grand volume (triage du support client sur un petit modèle rapide, par exemple) peut éclipser le coût du modèle plusieurs fois. Ce n'est pas une raison pour ignorer les garde-fous : c'est une raison pour dimensionner la pile en fonction de la surface de risque réelle au lieu d'exécuter chaque couche sur chaque requête par défaut.
Où sont les vraies économies
Deux leviers sont plus importants que le choix d'un fournisseur moins cher : pré-filtrer avec des heuristiques gratuites (listes de mots clés/regex, recherches de hachages incorrects) afin que seul le contenu ambigu atteigne l'API payante, et être honnête sur les couches dont votre produit a réellement besoin - voir la FAQ ci-dessus. L'auto-hébergement d'un modèle de garde-corps ouvert comme Llama Guard 3 ou Granite Guardian supprime entièrement les frais par article en échange de la possession d'une infrastructure d'inférence, qui constitue généralement le meilleur échange une fois que le volume est élevé et stable. Pour la couche de modération tarifée seule, consultez le calculateur de coût de modération de contenu; pour les dépenses d'évaluation/red-teaming plutôt que le filtrage de la production, voir le Calculateur de coût d'évaluation LLM.