HomeBlog › Warum LLM-Apps 429-Ratenlimits erreichen

Warum Ihre LLM-App 429 Fehler auslöst – die TPM-Rechnung erklärt niemand

Veröffentlicht am 28.06.2026 · Referenzgrenzen, überprüfen Sie diese in Ihrem Anbieter-Dashboard

Sie haben die Dokumente gelesen. Ihr Level erlaubt es 500 Anfragen pro Minute. Du schickst vielleicht acht. Und doch sind die Protokolle voll 429 Too Many Requests. An Ihrem Code stimmt nichts – Sie treffen den Fehler andere limit, das, was die meisten Tutorials überspringen: Token pro Minute (TPM). Jeder große LLM-Anbieter misst gleichzeitig RPM und TPM, und bei echten Eingabeaufforderungen greift fast immer zuerst das Token-Limit.

Zwei Grenzen, und diejenige, die tatsächlich bindet

Nehmen Sie die Einstiegsstufe von OpenAI für GPT-4o: ungefähr 500 U/min Und 30.000 TPM (Referenz, Juni 2026). Die Drehzahlzahl sieht großzügig aus. Aber eine Eingabeaufforderung mit erweiterter Abfrage und ein paar eingefügten Dokumenten kann problemlos funktionieren 4.000 Token in und 500 raus – nennen wir es 4.500 Token pro Anfrage. Führen Sie nun die Unterteilung durch, die in den Dokumenten nicht vorgesehen ist:

LimitWertMaximale Anfragen/Minute bei 4.500 Token
RPM (Anfragen/Min.)500500
TPM (Tokens/Min.)30,0006,7 ◀ bindet

Bei den Preisen handelt es sich um Referenzschätzungen, Juli 2026. Veralteten Preis melden →

Ihre wahre Obergrenze ist also weniger als sieben Anfragen pro Minute, nicht 500. Das Token-Limit begrenzt Sie auf 1,3 % des Anforderungslimits. Das ist der Grund, warum die 429er bei einstelligem Datenverkehr beginnen – und warum „langsamer senden“ oder „einen erneuten Versuch hinzufügen“ das Symptom und nicht die Ursache behandelt.

Machen Sie aus der Beschränkung etwas Planbares: gleichzeitige Benutzer

„Anfragen pro Minute“ ist abstrakt. Was Sie eigentlich wissen wollen, ist Wie viele Personen können die App gleichzeitig nutzen?. Wenn jeder aktive Benutzer ungefähr zwei Anfragen pro Minute auslöst, beträgt die Obergrenze 6,7 U/min drei gleichzeitige Benutzer bevor Anfragen in die Warteschlange gestellt werden. Gut für eine Demo; eine Wand für einen Start. Die Lösung ist selten eine schnellere Schleife – es ist einer von vier Hebeln:

Es ist nicht nur OpenAI

Überall existiert die gleiche Falle, manchmal sogar noch enger. Anthropics Eintrag Claude Tier ist da 50 U/min / 40.000 TPM; Googles kostenlose Gemini 2.5 Flash-Stufe ist großzügig bei Tokens (~250.000 TPM), aber geizig bei Anfragen (~10 RPM). Die Bindungsgrenze ändert sich je nachdem, ob Ihre Eingabeaufforderungen umfangreich sind oder Ihr Datenverkehr stark ansteigt – genau aus diesem Grund versagt eine einzelne Faustregel. Man muss einstecken dein Tokengröße.

Das ist unser neues Rate-Limit-Rechner Folgendes tut: Geben Sie eine Stufe (oder Ihr echtes TPM/RPM), Ihre Eingabe- und Ausgabetokens und die Häufigkeit der Anrufe jedes Benutzers ein. Anschließend erfahren Sie, wie viele Anfragen pro Minute effektiv sind, wie viele gleichzeitige Benutzer Sie bedienen können und welches Limit den Engpass darstellt. Dies ist der schnellste Weg, um herauszufinden, ob ein Start scheitern wird, bevor Ihre Benutzer es tun.

Das Essen zum Mitnehmen

429-Fehler unterhalb Ihres RPM-Limits sind kein Fehler – es handelt sich lediglich um das Token-pro-Minute-Limit, das seinen Zweck erfüllt. Größe Kapazität auf Token, nicht Anfrage zählt; Schneiden Sie den Kontext ab, bevor Sie zu Wiederholungsversuchen greifen. Und denken Sie daran, dass das Limit mit den Ausgaben steigt. Sobald Sie Ihre tatsächliche Obergrenze kennen, berechnen Sie den Traffic mit dem LLM-Token-Kostenrechner und modellieren Sie die gesamte App auf der Kostenschätzer für KI-Apps.

Tarifbegrenzungen sind Richtwerte (Juni 2026) und variieren je nach Anbieter, Modell und Kontostufe – bestätigen Sie sie immer in Ihrem Dashboard. Verwandt: Rate-Limit-Rechner - Einsparungen bei der Batch-API - Günstigste LLM-API.