✓ Zuletzt überprüft: 29.07.2026· SparsamGPT-Stil günstig → überprüfen → eskalieren· ein Problem melden →
A Modellkaskade läuft a Zuerst ein günstiges Modell, überprüft die Antwort und nur eskaliert diejenigen, denen es nicht gelingt, a Premium-Modell – das FrugalGPT-Muster. Aber Sie zahlen das Billigmodell weiter jeder Anfrage, plus a Prüfer, plus Prämie auf die eskalierte Aktie – es ist also nicht kostenlos. Dies kostet die echte Mischung monatliche Kosten einer Kaskade gegen Always-Premium und eine einfache Aufteilung, und findet das Eskalationsrate wo die Kaskade aufhört zu speichern.
Der Prüfer wird bei jeder Anfrage ausgeführt, nicht nur bei Eskalationen.
—
Kaskade / Mo
—Immer Premium / Mo
—Ersparnisse
—Break-Even-Eskalation
Woher die Kaskadenkosten kommen
Das günstige Modell und der Verifizierer werden auf das volle Volumen vergütet; Beim Prämienmodell wird nur auf den eskalierten Anteil vergütet. Zum Vergleich werden Always-Premium und eine einfache Traffic-Aufteilung angezeigt.
Komponente
Monatliche Kosten
Aktie
Einsparungen bei allen Eskalationsraten
Die Eskalationsrate ist der Swing-Faktor. Dadurch wird alles andere fixiert und schrittweise angezeigt, um zu zeigen, wo die Kaskade aufhört, immer Premium zu schlagen – die Break-Even-Zeile ist markiert.
Eskalation
Kaskade / Mo
Ersparnisse
Urteil
Ein günstiges Modell ist nicht automatisch gleich eine günstige Rechnung
Der Reiz einer Kaskade liegt auf der Hand: Die meisten Anfragen sind einfach, ein kleines Modell erledigt sie richtig und es ist Verschwendung, für einfache Arbeit hohe Preise zu zahlen. Führen Sie zuerst das Billigmodell aus, behalten Sie die Antworten bei, die eine Prüfung bestehen, und eskalieren Sie nur diejenigen, die fehlschlagen – das FrugalGPT-Ergebnis zeigte, dass dies zu einem Bruchteil der Kosten mit der Qualität eines Grenzmodells mithalten kann. Die Falle besteht darin, das Billigmodell als Gesamtkosten zu behandeln. Sie zahlen es bei jeder Anfrage, unabhängig davon, ob die Antwort erhalten bleibt oder nicht. Sie bezahlen auch für jede Anfrage einen Prüfer, denn etwas muss darüber entscheiden, was eskaliert, und das ist normalerweise ein weiterer Modellaufruf. Und für den Anteil, den Sie erhöhen, zahlen Sie das Premium-Modell zusätzlich zu dem günstigen Versuch, den Sie bereits unternommen haben. Wenn man diese addiert, ändert sich das Bild: Die Kaskade spart beträchtlich, wenn die Eskalation niedrig ist, schrumpft, wenn die Eskalation zunimmt, und ab einer Break-Even-Rate kostet sie mehr, als nur das Premium-Modell für alles in Anspruch zu nehmen – weil Sie das billige Modell und den Prüfer umsonst bezahlt haben und trotzdem den vollen Premium-Preis bezahlt haben. Dieser Rechner berechnet die Preise für alle drei Zweige anhand Ihrer eigenen Token-Anzahl und -Raten, vergleicht die Kaskade mit einer Immer-Premium-Verteilung und einer einfachen Traffic-Aufteilung, die sich nie doppelt auszahlt, und markiert die Eskalationsrate, bei der die Arithmetik umkehrt. Wenn Sie jede Anfrage im Voraus an ein einzelnes Modell weiterleiten, anstatt sie zu eskalieren, bepreisen Sie dies mit dem Modell-Router-Rechner; Um Caching-, Batch- und andere Hebel oben zu stapeln, verwenden Sie die Kostenoptimierungsrechner; und um die beiden Modelle selbst zu vergleichen, sehen Sie sich die an Modellvergleich.
Es beginnt mit den Kosten pro Anfrage jedes Modells: Eingabe-Tokens mal Eingabepreis plus Ausgabe-Tokens mal Ausgabepreis, dividiert durch eine Million. Beim günstigen Modell und beim Verifier wird das gesamte Anfragevolumen in Rechnung gestellt, ihre monatlichen Kosten entsprechen also der Zahl pro Anfrage multipliziert mit den Anfragen pro Monat. Beim Premium-Modell wird nur der eskalierte Anteil abgerechnet. Die monatlichen Kosten entsprechen also den Prämienkosten pro Anfrage mal Anfragen mal der Eskalationsrate. Die monatlichen Kaskadenkosten sind die Summe aller drei. „Immer Premium“ ist einfach die Prämie pro Anfrage, multipliziert mit dem Gesamtvolumen; Bei der zum Vergleich dargestellten einfachen Verkehrsaufteilung wird das günstige Modell für den nicht eskalierten Anteil und das Premium-Modell für den eskalierten Anteil ausgezahlt, niemals beides. Die Ersparnis ist eine Minuskaskade gegenüber der Dauerprämie. Die Break-Even-Eskalationsrate beträgt eins minus das Verhältnis der Kosten für „günstig plus Verifizierer“ pro Anfrage zu den Kosten für „Prämie pro Anfrage“: Unterhalb davon ist die Kaskade besser als „Immer Premium“, darüber ist „günstiger erster Versuch plus Verifizierer“ totes Gewicht und der direkte Übergang zu Premium ist billiger. Das Modell geht davon aus, dass eskalierte Anfragen in beiden Modellen dieselben Token-Anzahlen verwenden. Wenn Ihre Premium-Aufrufe länger dauern, erhöhen Sie die Anzahl der Premium-Token, um dies widerzuspiegeln.
Häufig gestellte Fragen
Was ist eine LLM-Kaskade und wie spart sie Geld?
Es beantwortet jede Anfrage mit dem günstigsten Modell, das damit umgehen kann: Ein günstiges Modell läuft zuerst, ein Prüfer entscheidet, ob die Antwort gut genug ist, und nur die Ausfälle eskalieren zu einem Premium-Modell. Die meisten Anfragen sind einfach, sodass sie mit dem günstigen Modell zu einem Bruchteil der Kosten erledigt werden können. Die Ersparnis ist real, aber Sie zahlen immer noch das günstige Modell und den Verifizierer bei jeder Anfrage plus Aufschlag auf den eskalierten Anteil.
Wie unterscheidet sich eine Kaskade vom Routing zwischen zwei Modellen?
Ein Router wählt im Voraus ein Modell aus, sodass jede Anfrage für ein Modell bezahlt und niemals doppelt bezahlt wird – aber eine Fehlroute liefert eine falsche Antwort. Eine Kaskade führt das Billigmodell auf alles aus und eskaliert Fehler, so dass eskalierte Anfragen günstig plus Verifizierer plus Premium bezahlt werden, aber jede harte Anfrage bekommt einen richtigen zweiten Versuch. Dieses Tool zeigt beide Kosten mit der gleichen Eskalationsrate an.
Bei welcher Eskalationsrate hört eine Kaskade auf zu sparen?
Bei der Break-Even-Eskalationsrate – eins minus dem Verhältnis der Kosten pro Anfrage für „billig plus Verifizierer“ zu den Kosten pro Anfrage für „Premium“. Darunter schlägt die Kaskade immer erstklassig; Darüber hinaus haben Sie das günstige Modell und den Prüfer mit geringem Nutzen bezahlt und dennoch die volle Prämie gezahlt, sodass ein direkter Anruf bei Premium günstiger ist. Je günstiger Ihr kleines Modell und Ihr Verifizierer sind, desto höher kann die Eskalation ansteigen, bevor die Kaskade in einen Verlust mündet.
Was zählt zu den Prüfkosten und warum ist das wichtig?
Der Verifizierer ist das, was über den Versand oder die Eskalation entscheidet – ein kleines Richtermodell, ein Selbstkonsistenzdurchlauf oder ein Einbettungsschwellenwert – und er wird bei jeder Anfrage ausgeführt, sodass sich bei der Lautstärke triviale Kosten pro Anruf summieren. Es legt auch den Mindestwert fest: Selbst bei Null-Eskalation zahlen Sie das günstige Modell plus den Verifizierer für das gesamte Volumen. Dieser Rechner behandelt es als erstklassige Eingabe, anstatt es auf Null zu runden.