Token vs. Anfragen erklärt

Was ein Token wirklich ist, wie er sich von einer API-Anfrage unterscheidet und wie man beides vor dem Erstellen abschätzt.

HeimLernen › Token vs. Anfragen erklärt

Eine Anfrage und ein Token sind nicht dasselbe

Ein API-Anfrage ist ein Aufruf an den Endpunkt. Token sind die Texteinheiten innerhalb dieses Aufrufs. Eine Anfrage kann eine Handvoll oder Hunderttausende Token enthalten. LLM-Anbieter rechnen per Token ab; Viele andere APIs (Zahlungen, Karten, SMS) berechnen pro Anfrage oder pro Aktion. Beides zu verwechseln ist der häufigste Fehler bei der Budgetierung.

Wo jedes Modell gilt

API-TypAbgerechnet von
LLM / KI (OpenAI, Anthropic usw.)Token (Eingabe + Ausgabe)
EinbettungenToken (nur Eingabe)
BilderzeugungPro Bild / pro Schritt
Karten, Suche, SMS, ZahlungenPro Anfrage / pro Aktion
Kosten Sie Ihren gesamten API-Stack →

So schätzen Sie vor dem Bau ab

Schätzen Sie für eine LLM-Funktion: Token pro Anruf × Anrufe pro Benutzer × Benutzer. Eine Chat-Antwort könnte etwa 500 Eingabe- und etwa 300 Ausgabe-Tokens umfassen. Multiplizieren Sie es mit den monatlichen Gesprächen, um das Token-Volumen zu erhalten, und bewerten Sie es dann. Dies ist weitaus genauer als die Schätzung „pro Anfrage“, da die Anzahl der Token pro Anfrage stark schwankt. Halten Sie Eingabe und Ausgabe durchgehend getrennt – die Preise der Anbieter sind unterschiedlich, oft liegt der Unterschied zwischen dem Drei- und Fünffachen, sodass eine kombinierte „durchschnittliche Token“-Schätzung deutlich daneben liegen kann.

Token-Kosten →Kosten des Kontextfensters →

Die gleiche Aufteilung zeigt sich auch bei den Ratenlimits

Most LLM providers cap usage on beide Achsen gleichzeitig: eine Obergrenze für Anfragen pro Minute (RPM) und eine Obergrenze für Tokens pro Minute (TPM). Welches Sie zuerst treffen, hängt ganz davon ab, wie viele Token Ihr durchschnittlicher Anruf trägt – um die genaue Zahl geht es auf dieser Seite.

Wenn Sie wissen, welches Limit Sie erreichen werden, ändert sich die Lösung: Eine RPM-gebundene Arbeitslast profitiert davon Chargenbildung mehrere kleine Aufrufe in einer größeren Anfrage (weniger Anfragen, gleiche Gesamtanzahl an Token), während eine TPM-gebundene Arbeitslast davon profitiert Trimmen Kontext oder Ausgabelänge, anstatt die Aufrufhäufigkeit zu reduzieren. Sehen API-Ratenbegrenzungen erklärt für die konkreten RPM/TPM-Stufen nach Anbieter.

Ausgearbeitetes Beispiel: Dimensionierung einer Chatbot-Funktion

Angenommen, Sie planen einen Support-Chatbot für 5.000 monatlich aktive Benutzer, jeweils gemittelt 2 Sitzungen/Monat von 3 Umdrehungen pro Stück. Jede Runde trägt ungefähr 900 Eingabetoken (Systemaufforderung + aktueller Konversationsverlauf + die Nachricht des Benutzers) und 250 Ausgabetoken.

Führen Sie die Input- und Output-Gesamtsummen separat für das von Ihnen gewählte Modell über einen Token-Kostenrechner durch. Da der Output teurer ist, können die 10 Mio. Output-Tokens genauso viel kosten wie die 24,5 Mio. Input-Tokens, auch wenn es nur ein Drittel des Volumens ist.

Chatbot-Kostenrechner →

Häufige Fehler, die eine Schätzung sprengen

Lernen Sie weiter

So funktioniert die LLM-API-Preisgestaltung →API-Ratenbegrenzungen →Glossar zu KI- und API-Kosten →

Häufig gestellte Fragen

Was ist der Unterschied zwischen einem Token und einer API-Anfrage?

Eine API-Anfrage ist ein einzelner Aufruf an den Endpunkt; Token sind die darin enthaltenen Texteinheiten. Eine Anfrage kann nur sehr wenige oder Hunderttausende Token enthalten. LLMs rechnen pro Token ab, während viele andere APIs pro Anfrage abrechnen.

Wie viele Token enthält eine typische Chatbot-Nachricht?

Eine kurze Benutzernachricht plus Systemaufforderung umfasst häufig einige hundert Eingabe-Tokens und eine Antwort einige hundert Ausgabe-Tokens – ungefähr 500–1.000 Tokens pro Austausch, obwohl dies je nach Länge der Aufforderung und Ausführlichkeit der Antwort variiert.

Wie schätze ich meine monatliche Token-Nutzung?

Multiplizieren Sie die Token pro Anruf mit den Anrufen pro Benutzer und der Anzahl der Benutzer. Schätzen Sie die Input- und Output-Tokens getrennt, da sie unterschiedliche Preise haben, und berechnen Sie dann die Gesamtsumme mit einem Token-Kostenrechner für das von Ihnen gewählte Modell.

Kostet ein Token gleich viel, unabhängig davon, ob es sich um einen Input oder einen Output handelt?

Nein – Output-Tokens sind in der Regel teurer als Input-Tokens für dasselbe Modell, oft 3–5x so viel. Wenn man die Input- und Output-Summen getrennt hält, anstatt sie zu einem Durchschnitt zusammenzufassen, erhält man eine viel genauere Kostenschätzung.

Was sollte ich außer den Token des Hauptmodells noch einplanen?

In einer RAG- oder Agent-Pipeline wird das Budget für Einbettungsanfragen, Vektordatenbankabfragen und alle kleineren Routing- oder Klassifizierungsmodellaufrufe separat von den Tokens des Hauptmodells abgerechnet und kann sich zu einer Funktion mit hohem Volumen summieren.

Zählen Ratenlimits Anfragen oder Token?

Normalerweise beides gleichzeitig – Anbieter legen eine separate Obergrenze für Anfragen pro Minute (RPM) und Token pro Minute (TPM) fest, und Sie treffen diejenige, die Ihr Verkehrsmuster zuerst auslastet. Bei hochfrequenten Kurzanrufen wird in der Regel zuerst die Drehzahl erreicht. Langkontextanrufe mit geringer Häufigkeit treffen in der Regel zuerst auf TPM.

Nur als pädagogische Referenz – Preise sind Schätzungen; Überprüfen Sie die aktuellen Tarife auf der Preisseite jedes Anbieters.

Tools & Hosting

📈 TradingView🔒 NordVPN💳 RevolutDigitalOcean $200Hostinger