Der Prüfer wird bei jeder Anfrage ausgeführt, nicht nur bei Eskalationen.
Kaskade / Mo
Immer Premium / Mo
Ersparnisse
Break-Even-Eskalation

Woher die Kaskadenkosten kommen

Das günstige Modell und der Verifizierer werden auf das volle Volumen vergütet; Beim Prämienmodell wird nur auf den eskalierten Anteil vergütet. Zum Vergleich werden Always-Premium und eine einfache Traffic-Aufteilung angezeigt.

KomponenteMonatliche KostenAktie

Einsparungen bei allen Eskalationsraten

Die Eskalationsrate ist der Swing-Faktor. Dadurch wird alles andere fixiert und schrittweise angezeigt, um zu zeigen, wo die Kaskade aufhört, immer Premium zu schlagen – die Break-Even-Zeile ist markiert.

EskalationKaskade / MoErsparnisseUrteil

Ein günstiges Modell ist nicht automatisch gleich eine günstige Rechnung

Der Reiz einer Kaskade liegt auf der Hand: Die meisten Anfragen sind einfach, ein kleines Modell erledigt sie richtig und es ist Verschwendung, für einfache Arbeit hohe Preise zu zahlen. Führen Sie zuerst das Billigmodell aus, behalten Sie die Antworten bei, die eine Prüfung bestehen, und eskalieren Sie nur diejenigen, die fehlschlagen – das FrugalGPT-Ergebnis zeigte, dass dies zu einem Bruchteil der Kosten mit der Qualität eines Grenzmodells mithalten kann. Die Falle besteht darin, das Billigmodell als Gesamtkosten zu behandeln. Sie zahlen es bei jeder Anfrage, unabhängig davon, ob die Antwort erhalten bleibt oder nicht. Sie bezahlen auch für jede Anfrage einen Prüfer, denn etwas muss darüber entscheiden, was eskaliert, und das ist normalerweise ein weiterer Modellaufruf. Und für den Anteil, den Sie erhöhen, zahlen Sie das Premium-Modell zusätzlich zu dem günstigen Versuch, den Sie bereits unternommen haben. Wenn man diese addiert, ändert sich das Bild: Die Kaskade spart beträchtlich, wenn die Eskalation niedrig ist, schrumpft, wenn die Eskalation zunimmt, und ab einer Break-Even-Rate kostet sie mehr, als nur das Premium-Modell für alles in Anspruch zu nehmen – weil Sie das billige Modell und den Prüfer umsonst bezahlt haben und trotzdem den vollen Premium-Preis bezahlt haben. Dieser Rechner berechnet die Preise für alle drei Zweige anhand Ihrer eigenen Token-Anzahl und -Raten, vergleicht die Kaskade mit einer Immer-Premium-Verteilung und einer einfachen Traffic-Aufteilung, die sich nie doppelt auszahlt, und markiert die Eskalationsrate, bei der die Arithmetik umkehrt. Wenn Sie jede Anfrage im Voraus an ein einzelnes Modell weiterleiten, anstatt sie zu eskalieren, bepreisen Sie dies mit dem Modell-Router-Rechner; Um Caching-, Batch- und andere Hebel oben zu stapeln, verwenden Sie die Kostenoptimierungsrechner; und um die beiden Modelle selbst zu vergleichen, sehen Sie sich die an Modellvergleich.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Modell-RouterKostenoptimierungSelbstkonsistenzModellvergleich