HomeTools › Kosten für die Fallback-Kette des KI-Modells
gemischte monatliche Kosten
Overhead vs. rein primär
Gemeinkosten %
gemischt $ / Anfrage

Was jeder Fallback-Tarif kostet

Gleiche Token, gleicher Datenverkehr – nur die primäre → Fallback-Triggerrate ändert sich.

RückfallrateMonatliche KostenOverhead vs. primärGemeinkosten %
⚠️ Schätzung. Es wird davon ausgegangen, dass ratenbegrenzte/fehlgeschlagene Anrufe nicht von der Ebene in Rechnung gestellt werden, die sie abgelehnt hat – es wird nur die Ebene in Rechnung gestellt, die die Anfrage abschließt. Standardpreise sind Referenzzahlen (Juli 2026) — Bestätigen Sie die aktuellen Token-Preise pro Million im Dashboard jedes Anbieters. · Veralteten Preis melden →

Die versteckten Kosten Ihrer Zuverlässigkeitsstufe

Eine Modell-Fallback-Kette ist das Standard-KI-Gateway-Muster 2026: Senden Sie die Anfrage an ein günstiges, schnelles Primärmodell; Wenn dieser Anruf ratenbegrenzt ist oder Fehler aufweist, versucht das Gateway (OpenRouter, Portkey, LiteLLM oder ein benutzerdefinierter Wrapper) automatisch einen erneuten Versuch mit einem teureren, zuverlässigeren Fallback-Modell und manchmal auch mit einer dritten Ebene, wenn auch der Fallback fehlschlägt. Es ist die richtige Architektur für die Betriebszeit – aber die Fallback-Stufe kostet normalerweise das 5- bis 20-fache der Primärstufe pro Token, gerade weil die Primärstufe aufgrund ihrer günstigen Kosten ausgewählt wurde. Eine Fallback-Rate, die in einem Dashboard vernachlässigbar erscheint – 5 %, sogar 2 % – kann die Rechnung weitaus mehr bewegen, als dieser Prozentsatz vermuten lässt.

Die Berechnung ist nicht linear, da die beiden Stufen nicht den gleichen Preis haben. Gemischte Kosten pro Anfrage = primäre_Kosten × (1 – p1) + Fallback-Kosten × p1 × (1 – p2) + tertiäre_Kosten × p1 × p2, wobei p1 die Primär-zu-Fallback-Triggerrate und p2 die (viel seltenere) Fallback-zu-Tertiär-Rate ist. Bei einem 14-fachen Preisunterschied zwischen den Stufen kann eine Fallback-Rate von 5 % die Gesamtrechnung um 50–65 % erhöhen, obwohl 95 % der Anfragen immer noch die günstige Primärseite erreichen – weil diese 5 % des Datenverkehrs mehr als die Hälfte der Gesamtkosten bezahlen.

Dies ist eine völlig andere Kostenform als bewusstes Modellrouting (wobei Sie die billige/teure Aufteilung nach Design wählen) oder einfach Wiederholung bei Fehler Kosten (wobei das gleiche Modell sich selbst erneut versucht). Hier ist das Eskalationsziel ein anderes, teureres Modell und wird durch Infrastrukturbedingungen – Kapazität, Ratengrenzen – und nicht durch die Schwierigkeit der Aufgabe ausgelöst.

Verwandt: Einsparungen bei der Modellführung, API-Wiederholungskosten, Kosten für die Migration von LLM-Anbietern, Agent-Loop-Budget.

Wie man es benutzt

1. Wählen Sie eine voreingestellte Kette oder geben Sie Ihre eigenen Preise pro Million für die Primär-, Fallback- und Tertiärstufe ein.
2. Geben Sie monatliche Anfragen und typische Ein-/Ausgabe-Tokens pro Anfrage ein.
3. Legen Sie Ihre beobachteten (oder geschätzten) primären → Fallback- und Fallback → tertiären Auslöseraten fest.
4. Lesen Sie die monatlichen Gesamtkosten und die Gemeinkosten im Vergleich zu einer rein primären Basislinie. Verwenden Sie die Tabelle, um zu sehen, wie empfindlich Ihre Rechnung auf die Fallback-Rate reagiert.

Häufige Fehler

Es wird davon ausgegangen, dass die Fallback-Kosten mit der Fallback-Rate skalieren. Das ist nicht der Fall – es skaliert mit der Fallback-Rate multipliziert mit dem Preisverhältnis zwischen den Stufen, das normalerweise viel größer ist. Ignorieren der Tertiärstufe. Wenn Ihr Fallback auch unter anhaltender Last ausfällt, kostet die Tertiärschicht (falls vorhanden) normalerweise genauso viel wie das Fallback, erhöht jedoch das Latenzrisiko – modellieren Sie es sogar bei einer niedrigen Rate. Abrechnung fehlgeschlagener Anrufe. Die meisten Anbieter erheben keine Gebühren für die Ablehnung einer harten Ratenbegrenzung. Wenn dies bei Ihnen der Fall ist (teilweise Generierung vor einem Mid-Stream-Fehler), ist Ihr tatsächlicher Overhead höher als diese Schätzung. Streben Sie nach 100 % Verfügbarkeit mit dem teuersten Fallback. Ein Mittelklasse-Fallback stellt oft den Großteil der Zuverlässigkeit zu einem Bruchteil der Kosten wieder her, die für den direkten Umstieg auf das Flaggschiff-Modell anfallen würden.

FAQ

Was ist eine KI-Modell-Fallback-Kette?

Ein Gateway-Muster, bei dem eine fehlgeschlagene oder ratenbegrenzte Anfrage automatisch erneut anhand eines Backup-Modells versucht wird, und optional einer dritten Ebene, wenn auch dies fehlschlägt. Wird von OpenRouter, Portkey, LiteLLM und ähnlichen Tools verwendet.

Warum kostet eine kleine Fallback-Rate so viel?

Fallback-Modelle liegen in der Regel preislich weit über dem Primärmodell pro Token. Selbst eine Triggerrate von 5 % kann die Rechnung um mehr als 50 % erhöhen, wenn der Fallback pro Anfrage das 10- bis 14-fache kostet.

Werden abgelehnte Anfragen in Rechnung gestellt?

Standardpraxis: Bei einer harten 429-Rate-Limit-Ablehnung werden 0 US-Dollar in Rechnung gestellt, da keine Token generiert wurden. Dieser Rechner geht von dieser Konvention aus.

Wie reduziere ich die Fallback-Rate günstig?

Erhöhen Sie das Ratenlimit Ihrer primären Stufe, fügen Sie Backoff und Wiederholungsversuche auf der primären Stufe vor der Eskalation hinzu, verteilen Sie den Datenverkehr auf Schlüssel/Anbieter oder fügen Sie einen Fallback auf mittlerer Stufe ein, anstatt direkt zum teuersten Modell zu springen.

Nur Schätzung. Die Modellpreise sind Richtwerte und ändern sich häufig. Überprüfen Sie die aktuellen Preise bei jedem Anbieter.