HomeTools › Coût de la chaîne de repli du modèle IA
coût mensuel mixte
frais généraux vs primaire pur
% de frais généraux
mixte $ / demande

Ce que coûte chaque taux de repli

Mêmes jetons, même trafic — seul le taux de déclenchement principal → secours change.

Taux de repliCoût mensuelFrais généraux ou primaires% de frais généraux
⚠️ Estimation. Suppose que les appels à débit limité/en échec ne sont pas facturés par le niveau qui les a rejetés : seul le niveau qui termine la demande est facturé. Les prix par défaut sont chiffres de référence (juillet 2026) — confirmez les prix actuels des jetons par million dans le tableau de bord de chaque fournisseur. · Signaler un prix obsolète →

Le coût caché de votre niveau de fiabilité

Une chaîne de secours de modèle est le modèle standard de passerelle AI 2026 : envoyer la demande à un modèle principal rapide et bon marché ; si cet appel est limité en débit ou comporte des erreurs, la passerelle (OpenRouter, Portkey, LiteLLM ou un wrapper personnalisé) réessaye automatiquement avec un modèle de secours plus coûteux et plus fiable, et parfois un troisième niveau si le secours échoue également. Il s'agit de la bonne architecture pour la disponibilité, mais le niveau de secours coûte généralement entre 5 et 20 fois le prix principal par jeton, précisément parce que le niveau principal a été choisi pour être bon marché. Un taux de repli qui semble négligeable dans un tableau de bord – 5 %, voire 2 % – peut faire varier la facture bien plus que ne le suggère ce pourcentage.

Le calcul n’est pas linéaire car les deux niveaux n’ont pas le même prix. Coût mixte par requête = coût_primaire × (1 − p1) + coût de repli × p1 × (1 − p2) + coût_tertiaire × p1 × p2, où p1 est le taux de déclenchement primaire vers repli et p2 est le taux de repli (beaucoup plus rare) vers le tertiaire. Avec un écart de prix de 14 × entre les niveaux, un taux de repli de 5 % peut ajouter 50 à 65 % à la facture mixte, même si 95 % des demandes atteignent toujours le primaire bon marché, car ces 5 % du trafic paient plus de la moitié du coût total en dollars.

Il s’agit d’une forme de coût véritablement différente de celle routage de modèle délibéré (où vous choisissez la répartition bon marché/cher par conception) ou un simple nouvelle tentative en cas d'échec coût (où le même modèle réessaye). Ici, l'objectif d'escalade est un modèle différent, plus coûteux, et il est déclenché par les conditions de l'infrastructure (capacité, limites de débit) et non par la difficulté de la tâche.

En rapport: économies de routage du modèle, Coût des nouvelles tentatives d'API, Coût de migration du fournisseur LLM, budget de la boucle d'agent.

Comment l'utiliser

1. Choisissez une chaîne prédéfinie ou saisissez vos propres prix par million pour les niveaux primaire, de secours et tertiaire.
2. Saisissez les demandes mensuelles et les jetons d'entrée/sortie typiques par demande.
3. Définissez vos taux de déclenchement primaire → de secours et de repli → tertiaires observés (ou estimés).
4. Lisez le coût mensuel combiné et les frais généraux par rapport à une référence purement primaire ; utilisez le tableau pour voir à quel point votre facture est sensible au taux de repli.

Erreurs courantes

En supposant que le coût de repli évolue avec le taux de repli. Ce n’est pas le cas : il évolue en fonction du taux de repli multiplié par le rapport de prix entre les niveaux, qui est généralement beaucoup plus élevé. Ignorer le niveau tertiaire. Si votre solution de secours échoue également sous une charge soutenue, le niveau tertiaire (le cas échéant) coûte généralement le même prix que la solution de secours, mais ajoute un risque de latence : modélisez-le même à un faible débit. Facturation des appels échoués. La plupart des fournisseurs ne facturent pas le rejet d'une limite de débit stricte ; si le vôtre le fait (génération partielle avant une erreur intermédiaire), votre surcharge réelle est supérieure à cette estimation. Rechercher une disponibilité de 100 % avec la solution de repli la plus coûteuse. Une solution de secours de niveau intermédiaire récupère souvent l’essentiel de la fiabilité pour une fraction du coût d’un passage direct au modèle phare.

FAQ

Qu'est-ce qu'une chaîne de repli de modèle d'IA ?

Un modèle de passerelle dans lequel une demande ayant échoué ou à débit limité réessaye automatiquement sur un modèle de sauvegarde, et éventuellement un troisième niveau si celui-ci échoue également. Utilisé par OpenRouter, Portkey, LiteLLM et des outils similaires.

Pourquoi un petit taux de repli coûte-t-il si cher ?

Les modèles de secours ont généralement un prix bien supérieur au prix principal par jeton. Même un taux de déclenchement de 5 % peut ajouter plus de 50 % à la facture si le repli coûte 10 à 14 fois plus par demande.

Les demandes rejetées sont-elles facturées ?

Pratique standard : un rejet strict de la limite de débit 429 facture 0 $, car aucun jeton n'a été généré. Cette calculatrice suppose cette convention.

Comment réduire le taux de repli à moindre coût ?

Augmentez la limite de débit de votre niveau principal, ajoutez des interruptions et des tentatives sur le niveau principal avant de l'escalader, répartissez le trafic entre les clés/fournisseurs ou insérez une solution de secours de niveau intermédiaire au lieu de passer directement au modèle le plus cher.

Estimation seulement. Les prix modèles sont des chiffres de référence et changent fréquemment — vérifiez les prix actuels auprès de chaque fournisseur.