| Metrisch | Pro Tag | Pro Monat |
|---|
Was kostet bei Wiederholungsversuchen eigentlich Geld?
429 Fehler selbst sind kostenlos — Es werden keine Token in Rechnung gestellt, wenn eine Anfrage vor Beginn der Verarbeitung ratenbegrenzt ist. Die tatsächlichen Kosten betragen:
- Wiederholungsanfragen — Bei jedem erneuten Versuch wird die vollständige Eingabeaufforderung erneut gesendet. Wenn der Wiederholungsversuch erfolgreich ist, zahlen Sie für die Token. Wenn Ihre Eingabe 2.000 Token beträgt, führen drei Wiederholungsversuche bei 3 % der Anfragen zu 0,09 zusätzlichen Eingaben pro erfolgreicher Anfrage.
- Timeout-Duplikate – wenn eine Anfrage zu lange dauert und Ihr Code es erneut versucht, das Original jedoch tatsächlich verarbeitet wurde. Sie zahlen für zwei Abschlüsse. Dies ist insbesondere bei großen Leistungsanforderungen kostspielig.
- Fehlgeschlagene Anfragen – Wenn alle Wiederholungsversuche ausgeschöpft sind und die Anfrage fehlschlägt, vergeuden Sie Latenz und etwaige teilweise Kosten für das Eingabe-Token, wenn der Anbieter bei Erhalt Gebühren erhebt.
Beheben Sie das Problem: Verwenden Sie einen lokalen Token-pro-Minute-Ratenbegrenzer (z. B. LangChain). ContextWindowExceededHandler oder ein einfacher Token-Bucket), um Bursts zu glätten, bevor sie die API erreichen. Dadurch entfallen die meisten 429er, ohne dass die Kosten steigen.
Verwandt: API-Budgetplaner · Kostenprognose · Kostenlose Start- und Landebahn
Häufig gestellte Fragen
Werden mir API-Aufrufe in Rechnung gestellt, die einen 429-Rate-Limit-Fehler zurückgeben?
Nein – 429-Fehler werden vor der Bearbeitung zurückgewiesen und Ihnen werden dafür keine Kosten berechnet. Die tatsächlichen Kosten sind die Wiederholungslogik, verzögerte Antworten und manchmal doppelte Abschlüsse, wenn die Wiederholungslogik Fehler aufweist.
Was ist ein exponentieller Backoff und warum erhöht er die Latenzkosten?
Exponentielles Backoff bedeutet, dass zwischen den Wiederholungsversuchen 1, 2, 4, 8 Sekunden gewartet werden müssen. Ein einzelner 429 mit 2 Wiederholungsversuchen erhöht die Latenz um 3–7 Sekunden. Wenn nachgelagerte Systeme über SLAs verfügen, verursacht dies tatsächliche Betriebskosten, selbst wenn die Token-Kosten Null sind.
Wie führen Wiederholungsversuche zu doppelten Gebühren?
Wenn eine Anfrage erfolgreich ist, aber eine Zeitüberschreitung auftritt, bevor die Antwort eintrifft, wird ein naiver Wiederholungsversuch erneut gesendet – und wenn der erste erfolgreich war, zahlen Sie für zwei Abschlüsse. Verwenden Sie immer Idempotenzschlüssel oder prüfen Sie die vorhandenen Ergebnisse, bevor Sie es bei Zeitüberschreitung erneut versuchen.
Wie hoch ist die durchschnittliche 429-Rate für LLM-APIs?
Bei starkem Datenverkehr kann die Fehlerquote 10–30 % betragen. Bei stetigem Datenverkehr deutlich unterhalb der Grenzwerte beträgt der Wert typischerweise weniger als 0,1 %. Die meisten Anbieter verwenden mittlerweile Token-pro-Minute-Limits, die Anfragen mit großem Kontext stärker bestrafen als Limits für die Anzahl der Anfragen.
Wie reduziere ich die Kosten für API-Wiederholungen?
Vier Ansätze: (1) Ratenbegrenzung lokal mit einem Token-Bucket. (2) Verwenden Sie eine Warteschlange mit kontrollierter Parallelität. (3) Richten Sie die asynchrone Verarbeitung ein, sodass Wiederholungsversuche im Hintergrund erfolgen. (4) Cache-Antworten für identische Eingabeaufforderungen.