HomeToolsLearn › Rate-Limit-Rechner
effektive Anfragen / min
gleichzeitig aktive Benutzer
verbindliche Grenze
Tokens/Min. verwendet bei Obergrenze

RPM vs. TPM-Obergrenze bei Ihrer Token-Größe

Der kleinere Balken ist derjenige, der Sie tatsächlich drosselt.

LimitWertMax. Anforderung/MinBindet?
⚠️ Schätzung. Voreingestellte Stufennummern sind Referenzzahlen (Juli 2026) – Anbieter legen Ratenlimits pro Modell fest und erhöhen diese mit Ihren Ausgaben. Die genauen TPM/RPM-Werte variieren je nach Konto. Bestätigen Sie Ihre tatsächlichen Limits immer im Anbieter-Dashboard. Für Batch-/asynchrone Endpunkte gelten separate, viel höhere Grenzwerte. · Veralteten Preis melden →

Warum zwei Grenzen und warum es wichtig ist

Jeder große LLM-Anbieter – OpenAI, Anthropic, Google, Mistral – misst Sie Anfragen pro Minute Und Token pro Minute gleichzeitig. Der Haken ist, dass die meisten Leute das Token-Limit vergessen. Ein Budget von 30.000 TPM klingt groß, bis Sie 4.000-Token-Eingabeaufforderungen senden: Das sind nur etwa 7 Anfragen pro Minute, bevor Sie sie erhalten 429 Too Many Requests, auch wenn das RPM-Limit möglicherweise Hunderte zulässt. Die Lösung besteht fast nie darin, „schneller zu senden“ – es geht darum, den Kontext zu kürzen, die Ausgabelänge zu begrenzen oder eine Nutzungsstufe nach oben zu verschieben.

Dieser Rechner erledigt die Division für Sie. Es benötigt beide Limits und Ihre Token pro Anfrage, findet die kleinere Obergrenze und wandelt sie in etwas um, das Sie planen können: gleichzeitig aktive Benutzer. Wenn Sie wissen, dass jeder Benutzer ungefähr zwei Anfragen pro Minute auslöst, sagt Ihnen die Benutzernummer, wie viele Personen ein Schlüssel bedient, bevor die Anfragen in die Warteschlange gestellt werden. Wenn Sie an die Wand stoßen, sind die ehrlichen Optionen: die Eingabeaufforderung verkleinern (oft der größte Hebel), verkürzen max_tokens, Stapel nicht dringender Arbeiten an der Asynchrone Batch-APIoder qualifizieren Sie sich für eine höhere Stufe, indem Sie mehr ausgeben.

Sobald der Durchsatz bemessen ist, legen Sie den Preis fest: der LLM-Token-Kostenrechner wandelt diese Token in Dollar um, und die Kostenschätzer für KI-Apps modelliert die gesamte Rechnung anhand Ihrer Benutzeranzahl. Ein Chat-Produkt erstellen? Der Chatbot-Kostenrechner verknüpft das Gesprächsvolumen sowohl mit den Kosten als auch mit dem Durchsatz.

Wie man es benutzt

1. Wählen Sie eine voreingestellte Stufe oder geben Sie die RPM- und TPM-Grenzwerte in Ihrem Anbieter-Dashboard ein.
2. Geben Sie die Eingabe- und Ausgabetokens ein, die eine typische Anfrage verwendet (die Ausgabe zählt auch für TPM).
3. Legen Sie fest, wie viele Anfragen ein aktiver Benutzer pro Minute sendet.
4. Lesen Sie die effektiven Anfragen pro Minute, gleichzeitige Benutzer und welches Limit den Engpass darstellt.

Häufige Fehler

Es werden nur Eingabetoken gezählt. Ausgabe-Tokens werden ebenfalls in Rechnung gestellt und sind ratenbegrenzt – ein gesprächiges Modell mit langen Antworten verbraucht TPM schnell. Dimensionierung auf die Drehzahlgrenze. Wenn Ihre Eingabeaufforderungen umfangreich sind, begrenzt TPM Sie zuerst; Die Drehzahl ist irrelevant. Vorausgesetzt, das Limit ist festgelegt. Die Stufen steigen automatisch, wenn Ihre Ausgaben steigen, sodass eine Mauer heute möglicherweise nächsten Monat verschwunden ist. Ausbrüche ignorieren. Bei den Grenzwerten handelt es sich um Durchschnittswerte pro Minute, die jedoch in kurzen Zeitfenstern durchgesetzt werden, sodass der Spitzenverkehr 429 Sekunden unter dem Durchschnitt liegt.

FAQ

Wie wandle ich ein TPM-Limit in Anfragen pro Minute um?

Teilen Sie TPM durch Token pro Anfrage (Eingabe + Ausgabe). Das Ergebnis ist Ihre tokenseitige Anforderungsobergrenze; Ihr tatsächlicher Höchstwert ist der kleinere Wert aus diesem Wert und dem Drehzahllimit.

Warum erhalte ich 429 Fehler unterhalb meines RPM-Limits?

Denn verbindlich ist stattdessen das Token-pro-Minute-Limit. Lange Eingabeaufforderungen oder Ausgaben erschöpfen das TPM, bevor Sie die Anforderungsanzahl erreichen. Verkleinern Sie die Länge der Eingabeaufforderung oder begrenzen Sie die Ausgabe.

Wie viele Benutzer kann ein API-Schlüssel bedienen?

Effektive Anfragen pro Minute ÷ Anfragen pro Benutzer pro Minute. Erhöhen Sie es, indem Sie Token kürzen, stapeln, eine Stufe nach oben verschieben oder die Last auf Schlüssel verteilen.

Teilen Batch-Endpunkte diese Grenzwerte?

Nein – asynchrone Batch-APIs haben ihre eigenen, viel höheren Limits und einen Rabatt auf Kosten der Latenz. Verwenden Sie sie für nicht interaktive Massenaufträge.

Nur Schätzung. Tarifbegrenzungen sind Richtwerte und variieren je nach Anbieter, Modell und Kontostufe – überprüfen Sie dies in Ihrem Dashboard.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Kostenrechner für API-AusfallzeitenRatengrenzkapazitätsrechnerAI-kostenloser Test-Burn-RechnerAPI-Plan-ÜberschreitungskostenrechnerKosten für gleichzeitige Anfragen