So funktioniert die LLM-API-Preisgestaltung

Tokens, Eingabe vs. Ausgabe, Kontextfenster – warum die gleiche Aufgabe bei einem Modell 50-mal mehr kosten kann als bei einem anderen, einfach erklärt.

HeimLernen › Was ist ein Token? (Und warum Ihnen das in Rechnung gestellt wird)

Was ist ein Token? (Und warum Ihnen das in Rechnung gestellt wird)

Jedes Mal, wenn Sie ein KI-Modell anrufen, wird Ihnen nicht das Wort, der Charakter oder die Anfrage in Rechnung gestellt. Die Abrechnung erfolgt nach dem Token. Zu verstehen, was ein Token eigentlich ist, ist das Nützlichste, was Sie lernen können, bevor Sie versuchen, Ihre API-Kosten zu kontrollieren.

Ein Token ist ein Textblock, kein Wort

Ein Token ist die Einheit, die ein Sprachmodell liest und schreibt. Normalerweise handelt es sich eher um ein Fragment eines Wortes als um ein ganzes Wort. Gebräuchliche kurze Wörter wie the oder and sind ein einzelnes Zeichen, aber längere oder seltenere Wörter werden in mehrere Teile aufgeteilt. Zum Beispiel das Wort tokenization könnte eingebrochen werden token + ization, zwei Token.

Eine weit verbreitete grobe Regel für Englisch lautet: 1 Token besteht aus etwa 4 Zeichen oder etwa 0,75 Wörtern. Das bedeutet, dass 1.000 Token etwa 750 Wörtern entsprechen und eine einzelne Textseite (etwa 500 Wörter) etwa 650–700 Tokens umfasst. Hierbei handelt es sich um Näherungswerte und nicht um Garantien, da die genaue Aufteilung vom Tokenizer des Modells abhängt.

Auch Leerzeichen, Satzzeichen und Zeilenumbrüche zählen. Sogar die unsichtbare Struktur Ihrer Eingabeaufforderung verbraucht Token.

Warum Modelle Token anstelle von Wörtern verwenden

Sprachmodelle verstehen Buchstaben oder Wörter nicht direkt. Sie wandeln Text in Zahlen um und der Token ist die Brücke. Jeder Spielstein ist einem Eintrag im Vokabular des Modells zugeordnet, und das Modell führt seine gesamten Berechnungen anhand dieser nummerierten Teile durch.

Dieses Design ermöglicht es einem Modell, jede Sprache, jeden Code, jedes Emoji oder jedes erfundene Wort ohne ein festes Wörterbuch vollständiger Wörter zu verarbeiten. Ein seltener technischer Begriff, den das Modell noch nie als Ganzes gesehen hat, kann immer noch als Abfolge bekannter Unterteile dargestellt werden. Der Nachteil besteht darin, dass ungewöhnliche Texte, Codes oder nicht-englische Sprachen häufig mehr Token pro Wort verwenden als einfache englische Prosa.

Input-Tokens und Output-Tokens haben unterschiedliche Preise

Fast jeder Anbieter berechnet zwei separate Tarife: einen für Eingabe-Tokens (alles, was Sie senden, einschließlich Ihrer Eingabeaufforderung, Systemanweisungen und etwaiger Gesprächshistorie) und eine für Ausgabetoken (alles, was das Modell zurückgeneriert). Output-Tokens sind in der Regel um ein Vielfaches teurer als Input-Tokens.

Hier ist ein anschauliches Beispiel, um die Mechanik zu veranschaulichen (aus Gründen der Klarheit erfundene Zahlen, keine realen Preise): Wenn der Input 1 US-Dollar pro Million Token kostet und der Output 5 US-Dollar pro Million Token, dann würde ein Anruf, der 2.000 Input-Tokens sendet und 500 Output-Tokens empfängt, (2.000 / 1.000.000 x 1 US-Dollar) + (500 / 1.000.000 x 5 US-Dollar) = 0,002 US-Dollar kosten + 0,0025 $ = 0,0045 $. Klein pro Anruf, aber multipliziert mit Hunderttausenden von Anrufen ist es wichtig.

Um die realen Tarife pro Modell nebeneinander zu sehen, werden im Modellvergleich und auf den Seiten /models die aktuellen Ein- und Ausgabepreise für jeden Anbieter aufgeführt, sodass Sie nicht raten müssen.

Der Gesprächsverlauf wird bei jeder Runde abgerechnet

Die häufigste Abrechnungsüberraschung ist, dass Chat-Modelle zustandslos sind. Das Modell merkt sich Ihre vorherigen Nachrichten zwischen den Anrufen nicht. Um den Kontext beizubehalten, sendet Ihre Anwendung bei jeder neuen Runde den gesamten Konversationsverlauf erneut.

Das bedeutet, dass ein langer Chat mit jeder Nachricht teurer wird, da das wachsende Transkript jedes Mal erneut als Eingabe-Token gesendet wird. Eine Konversation mit 20 Nachrichten kann in ihrer letzten Runde still und leise Zehntausende von Eingabe-Tokens senden. Wenn Ihre Kosten während längerer Sitzungen steigen, ist dies normalerweise der Grund. Prompt-Caching (das in einem eigenen Leitfaden behandelt wird) ist eine Möglichkeit, dies abzumildern.

So schätzen Sie Ihre Rechnung vor dem Bau ein

Mit drei Zahlen können Sie eine praktikable Schätzung erhalten: durchschnittliche Eingabe-Tokens pro Anruf, durchschnittliche Ausgabe-Tokens pro Anruf und wie viele Anrufe Sie pro Tag oder Monat erwarten. Multiplizieren Sie die Anzahl jedes Tokens mit der Rate pro Token und addieren Sie sie.

  • Schätzen Sie die Anzahl der Token indem Sie eine realistische Beispielaufforderung und -antwort nehmen und dann die Zeichenanzahl durch 4 dividieren, oder für die Genauigkeit ein Tokenizer-Tool verwenden.
  • Mit Volumen multiplizieren um eine Tages- oder Monatszahl zu erhalten.
  • Fügen Sie einen Puffer hinzu von 20–30 % für Wiederholungsversuche, länger als erwartete Ausgaben und wachsenden Chatverlauf.

Der LLM-Kostenrechner erledigt diese Berechnung für Sie: Geben Sie Ihre Token-Anzahl und Ihr Anrufvolumen ein, wählen Sie ein Modell aus und er gibt die geschätzten monatlichen Kosten zurück, sodass Sie Optionen vergleichen können, bevor Sie Code schreiben.

Praktische Möglichkeiten, weniger Token zu verwenden

Wenn man in Token denkt, werden Einsparungen offensichtlich. Trimmen Sie Systemansagen, die bei jedem Anruf dieselben Anweisungen wörtlich wiederholen. Fassen Sie alte Gesprächsrunden zusammen, anstatt sie vollständig erneut zu senden. Fordern Sie eine prägnante Ausgabe an, wenn Sie keine langen Antworten benötigen, da Ausgabe-Tokens am meisten kosten.

Die Wahl eines kleineren Modells für einfache Aufgaben ist oft der größte Hebel von allen, da der Preisunterschied pro Token zwischen einem Flaggschiff- und einem Leichtgewichtsmodell das Zehnfache oder mehr betragen kann. Passen Sie das Modell an die Schwierigkeit der Aufgabe an, anstatt standardmäßig das leistungsstärkste Modell zu verwenden.

Häufig gestellte Fragen

Wie viele Token hat ein typischer Satz?

Ein kurzer englischer Satz mit 15 bis 20 Wörtern besteht normalerweise aus etwa 20 bis 30 Token. Als Faustregel gilt: Erwarten Sie ungefähr 0,75 Wörter pro Token, sodass die Anzahl der Token etwas höher ist als die Anzahl der Wörter.

Muss ich in der Antwort des Modells für Token bezahlen?

Ja. Ausgabe-Tokens werden getrennt von Eingabe-Tokens abgerechnet und sind in der Regel die teureren von beiden, sodass längere Antworten deutlich mehr kosten.

Warum kostet nicht-englischer Text mehr?

Die meisten Tokenizer sind für Englisch optimiert, sodass andere Sprachen und Code oft in mehr Token pro Wort aufgeteilt werden. Die gleiche Bedeutung kann in einigen Sprachen 1,5–2x mehr Token kosten.

Nur zu Bildungszwecken – keine Finanzberatung.