So funktioniert dieser Rechner
Der Ratengrenzkapazitätsrechner Ermittelt, wie viele gleichzeitig aktive Benutzer Ihre Anwendung bedienen kann, bevor ein API-Anbieter mit der Drosselung von Anforderungen beginnt. Dabei werden keine Dollarkosten geschätzt, sondern die beiden Tarifobergrenzen Ihres Kontos in eine Headroom-Zahl umgewandelt. Sie betreten die Token-Limit (TPM) Und Anforderungslimit (RPM) von Ihrem Anbieter, plus Ihre Auslastungsform: Token pro Anfrage Und Anfragen pro aktivem Benutzer pro Minute. Das Tool dividiert jede Obergrenze durch Ihre Nachfrage pro Benutzer und meldet die untere Dies ist eines der beiden Ergebnisse, da die Kapazität durch die Grenze bestimmt wird, die Sie zuerst erreichen – Token-Durchsatz oder Anzahl der Anfragen.
Der wichtigste Kompromiss besteht darin TPM und RPM gehen unterschiedlich schnell zur Neige, und welche bindet, hängt von der Größe Ihrer Anfrage ab. Große Eingabeaufforderungen oder lange Abschlüsse bringen Sie an die Token-Grenze, während die Anzahl der Anfragen ungenutzt bleibt. Viele kleine Anrufe bewirken das Gegenteil. Der Praxistipp lautet: Überprüfen welche Begrenzen Sie die Rechnerflags als Engpass, bevor Sie hochskalieren. Wenn Token zuerst gebunden werden, wird durch das Kürzen des Kontexts oder der Ausgabelänge mehr Benutzerkapazität erworben, als dies bei einem höheren Anforderungskontingent der Fall wäre. Wenn Anforderungen zuerst gebunden werden, hilft es am meisten, mehrere Vorgänge in einem Aufruf zusammenzufassen. Die Dimensionierung auf das Bindungslimit verhindert gedrosselte Anfragen und fehlgeschlagene Antworten bei Datenverkehrsspitzen.
Häufig gestellte Fragen
Wie interagieren TPM- und RPM-Grenzwerte?
Die Anbieter begrenzen sowohl die Anzahl der Tokens pro Minute (TPM) als auch die Anzahl der Anfragen pro Minute (RPM), und Sie wählen, was zuerst eintritt. Kleine, häufige Anrufe erreichen normalerweise die Drehzahl; Aufrufe mit großem Kontext treffen TPM. Ihre tatsächliche Kapazität ist die niedrigere von beiden, daher ändert eine Erhöhung nur der unverbindlichen Grenze nichts.
Wie kann ich mehr Benutzer bedienen, ohne auf Ratenbeschränkungen zu stoßen?
Heben Sie das Bindungslimit an – fordern Sie eine höhere Stufe für die Obergrenze an, stapeln oder kombinieren Sie kleine Anfragen, um den RPM zu vereinfachen, und kürzen Sie die Eingabeaufforderungsgröße, um das TPM zu vereinfachen. Durch das Zwischenspeichern wiederholter Kontexte und das Weiterleiten eines Überlaufs an einen zweiten Schlüssel oder ein zweites Modell wird die Last ebenfalls über einen einzelnen Grenzwert hinaus verteilt.