✓ Dernière vérification : 2026-07-29· Style FrugalGPT bon marché → vérifier → escalader· signaler un problème →
UN cascade de modèles dirige un modèle bon marché d'abord, vérifie la réponse, et seulement dégénère ceux auxquels il échoue modèle haut de gamme — le modèle FrugalGPT. Mais vous payez le modèle bon marché chaque demande, plus un vérificateur, plus la prime sur la part augmentée — ce n'est donc pas gratuit. Ce prix est le vrai mélange coût mensuel d'une cascade contre toujours-premium et un simple partage, et trouve le taux d'escalade où la cascade arrête de sauvegarder.
Le vérificateur s'exécute sur chaque demande, pas seulement sur les escalades.
—
cascade / mois
—toujours premium / mois
—économies
—augmentation du seuil de rentabilité
D’où vient le coût en cascade
Le modèle bon marché et le vérificateur sont payés sur le volume total ; le modèle premium est payé uniquement sur la part majorée. Les tarifs toujours premium et une répartition simple du trafic sont présentés à titre de comparaison.
Composant
Coût mensuel
Partager
Économies sur les taux d’indexation
Le taux d’escalade est le facteur de swing. Cela maintient tout le reste fixe et l'étape pour montrer où la cascade arrête de battre toujours premium - la ligne du seuil de rentabilité est marquée.
Escalade
Cascade / mois
Économies
Verdict
Un modèle bon marché n’est pas une facture bon marché par défaut
L'attrait d'une cascade est évident : la plupart des demandes sont faciles, un petit modèle y répond correctement, et payer des prix élevés pour un travail facile est du gaspillage. Exécutez d'abord le modèle bon marché, conservez les réponses qui réussissent le contrôle et ne faites remonter que celles qui échouent. Le résultat de FrugalGPT a montré que cela peut égaler la qualité d'un modèle frontière à une fraction du coût. Le piège consiste à considérer le modèle bon marché comme le coût total. Vous le payez à chaque demande, que la réponse survive ou non. Vous payez également un vérificateur à chaque demande, car quelque chose doit décider de ce qui dégénère, et ce quelque chose est généralement un autre appel modèle. Et sur la part que vous augmentez, vous payez le modèle premium en plus de la tentative bon marché que vous avez déjà faite. Additionnez-les et le tableau change : la cascade permet d'économiser beaucoup lorsque l'escalade est faible, diminue à mesure que l'escalade augmente, et au-delà d'un taux d'équilibre, cela coûte plus cher que de simplement appeler le modèle premium sur tout - parce que vous avez payé le modèle bon marché et le vérificateur pour rien et avez quand même payé le plein prix premium. Ce calculateur évalue les trois segments à partir de votre propre nombre de jetons et de vos tarifs, compare la cascade à un trafic toujours premium et à une répartition du trafic simple qui ne paie jamais deux fois, et marque le taux d'escalade là où l'arithmétique s'inverse. Si vous acheminez chaque demande vers un seul modèle dès le départ au lieu de l'escalader, fixez le prix avec le calculateur de modèle de routeur; pour empiler la mise en cache, le traitement par lots et d'autres leviers par-dessus, utilisez le calculateur d'optimisation des coûts; et pour comparer les deux modèles eux-mêmes, voir le comparaison de modèles.
Cela part du coût par requête de chaque modèle : les jetons d'entrée multipliés par le prix d'entrée plus les jetons de sortie multipliés par le prix de sortie, divisés par un million. Le modèle bon marché et le vérificateur sont facturés sur le volume total des demandes, leur coût mensuel correspond donc au nombre par demande multiplié par les demandes par mois. Le modèle premium est facturé uniquement sur la part augmentée, son coût mensuel correspond donc au coût par demande premium multiplié par les demandes multipliées par le taux d'escalade. Le coût mensuel en cascade est la somme des trois. Always-Premium est simplement le coût premium par demande multiplié par le volume total ; la répartition simple du trafic – présentée à titre de comparaison – paie le modèle bon marché sur la part non augmentée et le modèle premium sur la part augmentée, jamais les deux. Les économies représentent une cascade moins par rapport à la prime toujours. Le taux d'escalade du seuil de rentabilité est égal à un moins le rapport entre le coût par demande bon marché plus vérificateur et le coût par demande premium : en dessous, la cascade bat toujours premium, au-dessus, la première tentative bon marché plus vérificateur est un poids mort et passer directement au premium est moins cher. Le modèle suppose que les demandes escaladées utilisent le même nombre de jetons sur les deux modèles ; si vos appels premium sont plus longs, augmentez le nombre de jetons premium pour le refléter.
Questions fréquemment posées
Qu'est-ce qu'une cascade LLM et comment permet-elle d'économiser de l'argent ?
Il répond à chaque demande avec le modèle le moins cher capable de la gérer : un modèle bon marché s'exécute en premier, un vérificateur décide si la réponse est assez bonne, et seuls les échecs se transforment en modèle premium. La plupart des demandes sont simples, donc le modèle bon marché les traite à une fraction du coût. L'économie est réelle, mais vous payez toujours le modèle et le vérificateur bon marché pour chaque demande, plus une prime sur la part augmentée.
En quoi une cascade est-elle différente du routage entre deux modèles ?
Un routeur sélectionne un modèle à l’avance, de sorte que chaque demande paie pour un modèle et ne paie jamais deux fois – mais un mauvais itinéraire renvoie une mauvaise réponse. Une cascade exécute le modèle bon marché sur tout et escalade les échecs, de sorte que les demandes escaladées paient pas cher plus le vérificateur plus la prime, mais chaque demande difficile fait l'objet d'une deuxième tentative appropriée. Cet outil affiche les deux coûts au même taux d’indexation.
À quel taux d’escalade une cascade arrête-t-elle d’économiser ?
Au taux d'escalade du seuil de rentabilité : un moins le rapport entre le coût par demande bon marché plus vérificateur et le coût par demande premium. En dessous, la cascade bat toujours premium ; au-dessus, vous avez payé le modèle et le vérificateur bon marché pour peu d'avantages et vous avez quand même payé la totalité de la prime, donc appeler directement la prime est moins cher. Plus votre petit modèle et votre vérificateur sont bon marché, plus l’escalade peut grimper avant que la cascade ne se transforme en perte.
Qu’est-ce qui compte comme coût du vérificateur et pourquoi est-ce important ?
Le vérificateur est tout ce qui décide d'expédier ou de faire remonter – un petit modèle de jugement, une passe d'auto-cohérence ou un seuil d'intégration – et il s'exécute à chaque demande, donc un coût par appel qui semble trivial s'ajoute au volume. Cela fixe également le ton : même avec une escalade nulle, vous payez le modèle bon marché plus le vérificateur sur l'ensemble du volume. Cette calculatrice le traite comme une entrée de première classe plutôt que de l’arrondir à zéro.