Eine Anfrage und ein Token sind nicht dasselbe
Ein API-Anfrage ist ein Aufruf an den Endpunkt. Token sind die Texteinheiten innerhalb dieses Aufrufs. Eine Anfrage kann eine Handvoll oder Hunderttausende Token enthalten. LLM-Anbieter rechnen per Token ab; Viele andere APIs (Zahlungen, Karten, SMS) berechnen pro Anfrage oder pro Aktion. Beides zu verwechseln ist der häufigste Fehler bei der Budgetierung.
Wo jedes Modell gilt
| API-Typ | Abgerechnet von |
|---|---|
| LLM / KI (OpenAI, Anthropic usw.) | Token (Eingabe + Ausgabe) |
| Einbettungen | Token (nur Eingabe) |
| Bilderzeugung | Pro Bild / pro Schritt |
| Karten, Suche, SMS, Zahlungen | Pro Anfrage / pro Aktion |
So schätzen Sie vor dem Bau ab
Schätzen Sie für eine LLM-Funktion: Token pro Anruf × Anrufe pro Benutzer × Benutzer. Eine Chat-Antwort könnte etwa 500 Eingabe- und etwa 300 Ausgabe-Tokens umfassen. Multiplizieren Sie es mit den monatlichen Gesprächen, um das Token-Volumen zu erhalten, und bewerten Sie es dann. Dies ist weitaus genauer als die Schätzung „pro Anfrage“, da die Anzahl der Token pro Anfrage stark schwankt. Halten Sie Eingabe und Ausgabe durchgehend getrennt – die Preise der Anbieter sind unterschiedlich, oft liegt der Unterschied zwischen dem Drei- und Fünffachen, sodass eine kombinierte „durchschnittliche Token“-Schätzung deutlich daneben liegen kann.
Token-Kosten →Kosten des Kontextfensters →Die gleiche Aufteilung zeigt sich auch bei den Ratenlimits
Most LLM providers cap usage on beide Achsen gleichzeitig: eine Obergrenze für Anfragen pro Minute (RPM) und eine Obergrenze für Tokens pro Minute (TPM). Welches Sie zuerst treffen, hängt ganz davon ab, wie viele Token Ihr durchschnittlicher Anruf trägt – um die genaue Zahl geht es auf dieser Seite.
- Kurze Anrufe, hohe Frequenz (z. B. ein Klassifikator, der bei jedem Tastendruck ausgelöst wird) neigen dazu, das zu treffen U/min zuerst die Obergrenze – jeder Anruf ist in Token günstig, aber es gibt viele davon.
- Lange Anrufe, geringere Frequenz (z. B. ein Dokumentenzusammenfassungsendpunkt mit einem 20.000-Token-Kontext) neigen dazu, das zu treffen TPM Zuerst die Obergrenze – eine Handvoll Aufrufe können das Token-Budget bereits sättigen.
Wenn Sie wissen, welches Limit Sie erreichen werden, ändert sich die Lösung: Eine RPM-gebundene Arbeitslast profitiert davon Chargenbildung mehrere kleine Aufrufe in einer größeren Anfrage (weniger Anfragen, gleiche Gesamtanzahl an Token), während eine TPM-gebundene Arbeitslast davon profitiert Trimmen Kontext oder Ausgabelänge, anstatt die Aufrufhäufigkeit zu reduzieren. Sehen API-Ratenbegrenzungen erklärt für die konkreten RPM/TPM-Stufen nach Anbieter.
Ausgearbeitetes Beispiel: Dimensionierung einer Chatbot-Funktion
Angenommen, Sie planen einen Support-Chatbot für 5.000 monatlich aktive Benutzer, jeweils gemittelt 2 Sitzungen/Monat von 3 Umdrehungen pro Stück. Jede Runde trägt ungefähr 900 Eingabetoken (Systemaufforderung + aktueller Konversationsverlauf + die Nachricht des Benutzers) und 250 Ausgabetoken.
- Token pro Spielzug: 900 + 250 = 1,150
- Umdrehungen pro Benutzer/Monat: 3 × 2 = 6
- Tokens pro Benutzer/Monat: 1.150 × 6 = 6,900 (≈4.900 Eingang / 1.500 Ausgang)
- Gesamte monatliche Token: 6.900 × 5.000 = 34,5 Mio (≈24,5 Mio. Eingabe / ~10 Mio. Ausgabe)
Führen Sie die Input- und Output-Gesamtsummen separat für das von Ihnen gewählte Modell über einen Token-Kostenrechner durch. Da der Output teurer ist, können die 10 Mio. Output-Tokens genauso viel kosten wie die 24,5 Mio. Input-Tokens, auch wenn es nur ein Drittel des Volumens ist.
Chatbot-Kostenrechner →Häufige Fehler, die eine Schätzung sprengen
- Kombination von Input und Output zu einem Preis. Output-Token betragen normalerweise das Drei- bis Fünffache des Input-Preises – wenn man beide zum Input-Preis schätzt, ist die Rechnung zu niedrig angesetzt.
- Verärgerte Geschichte vergessen. Multi-Turn-Chat, der bei jedem Anruf vorherige Nachrichten erneut sendet, bedeutet, dass die Token-Anzahl pro Runde im Verlauf einer Sitzung zunimmt, nicht nur pro Nachricht.
- Schätzung anhand von Zeichen, nicht anhand von Token. Die Anzahl der Token pro Zeichen variiert je nach Sprache und Inhalt – Code, JSON und nicht-englischer Text verwenden normalerweise mehr Token pro Zeichen als einfaches Englisch.
- Wiederholungsversuche werden ignoriert. Ein fehlgeschlagener Aufruf, der erneut versucht wird, verbraucht immer noch das Anforderungskontingent und häufig auch Token, sodass fehleranfällige Integrationen mehr kosten, als die Happy-Path-Berechnung vermuten lässt.
- Den Rest der Pipeline überspringen. Eine RAG- oder Agentenfunktion fügt normalerweise Einbettungsanfragen, Vektorsuchaufrufe und manchmal ein kleineres Routing-Modell hinzu – jedes wird separat abgerechnet, getrennt von den Tokens des Hauptmodells.
Lernen Sie weiter
So funktioniert die LLM-API-Preisgestaltung →API-Ratenbegrenzungen →Glossar zu KI- und API-Kosten →Häufig gestellte Fragen
Was ist der Unterschied zwischen einem Token und einer API-Anfrage?
Eine API-Anfrage ist ein einzelner Aufruf an den Endpunkt; Token sind die darin enthaltenen Texteinheiten. Eine Anfrage kann nur sehr wenige oder Hunderttausende Token enthalten. LLMs rechnen pro Token ab, während viele andere APIs pro Anfrage abrechnen.
Wie viele Token enthält eine typische Chatbot-Nachricht?
Eine kurze Benutzernachricht plus Systemaufforderung umfasst häufig einige hundert Eingabe-Tokens und eine Antwort einige hundert Ausgabe-Tokens – ungefähr 500–1.000 Tokens pro Austausch, obwohl dies je nach Länge der Aufforderung und Ausführlichkeit der Antwort variiert.
Wie schätze ich meine monatliche Token-Nutzung?
Multiplizieren Sie die Token pro Anruf mit den Anrufen pro Benutzer und der Anzahl der Benutzer. Schätzen Sie die Input- und Output-Tokens getrennt, da sie unterschiedliche Preise haben, und berechnen Sie dann die Gesamtsumme mit einem Token-Kostenrechner für das von Ihnen gewählte Modell.
Kostet ein Token gleich viel, unabhängig davon, ob es sich um einen Input oder einen Output handelt?
Nein – Output-Tokens sind in der Regel teurer als Input-Tokens für dasselbe Modell, oft 3–5x so viel. Wenn man die Input- und Output-Summen getrennt hält, anstatt sie zu einem Durchschnitt zusammenzufassen, erhält man eine viel genauere Kostenschätzung.
Was sollte ich außer den Token des Hauptmodells noch einplanen?
In einer RAG- oder Agent-Pipeline wird das Budget für Einbettungsanfragen, Vektordatenbankabfragen und alle kleineren Routing- oder Klassifizierungsmodellaufrufe separat von den Tokens des Hauptmodells abgerechnet und kann sich zu einer Funktion mit hohem Volumen summieren.
Zählen Ratenlimits Anfragen oder Token?
Normalerweise beides gleichzeitig – Anbieter legen eine separate Obergrenze für Anfragen pro Minute (RPM) und Token pro Minute (TPM) fest, und Sie treffen diejenige, die Ihr Verkehrsmuster zuerst auslastet. Bei hochfrequenten Kurzanrufen wird in der Regel zuerst die Drehzahl erreicht. Langkontextanrufe mit geringer Häufigkeit treffen in der Regel zuerst auf TPM.
Nur als pädagogische Referenz – Preise sind Schätzungen; Überprüfen Sie die aktuellen Tarife auf der Preisseite jedes Anbieters.