HomeToolsLearn › Kontextfensterrechner
des verwendeten Kontextfensters
Verwendete Token / Fenster
mehr Kurven, die noch passen
Kosten pro Anruf

Gleiches Gespräch bei allen Modellen

Fensterfüllung und Kosten pro Anruf für die oben genannten Eingaben.

ModellFenster% gebrauchtWendet sich nach linksKosten/Anruf
⚠️ Schätzung. Die Anzahl der Token ist ungefähr (1 Token entspricht 0,75 englischen Wörtern; Code und andere Sprachen unterscheiden sich). Kontextfenster und Preise sind Referenzzahlen (Juli 2026) und variieren je nach Modellversion und Anbieter – überprüfen Sie dies in den Dokumenten des Anbieters und in Ihrem Dashboard. · Veralteten Preis melden →

Warum sich das Fenster schneller füllt, als Sie denken

Bei einem Kontextfenster geht es nicht nur darum, wie lange ein Dokument eingefügt werden kann. In einer echten Chat-App liest das Model das noch einmal gesamtes Gespräch bei jeder einzelnen Runde, da die API zustandslos ist – sie hat keinen Speicher zwischen den Aufrufen, sodass Sie den Verlauf jedes Mal erneut senden. Eine 200-Token-Systemaufforderung plus zehn Runden mit 250-Token-Nachrichten sind bereits 2.800 Token, bevor der Benutzer überhaupt seine nächste Frage eingegeben hat und der gesamte Block gesendet wird wieder nächste Runde. Fügen Sie reservierten Platz für die Antwort hinzu und Sie können sehen, wie ein „kleiner“ Chat an seine Grenzen stößt und warum Ihre Rechnung steigt, wenn ein Gespräch länger wird.

Dieser Rechner trennt die vier Teile – Systemaufforderung, Verlauf erneut gesendeter Nachrichten, neuer Nachrichtenraum und reservierte Ausgabe – und zeigt die Gesamtsumme im Fenster jedes Modells an. Der Schlagzeilenprozentsatz sagt Ihnen, wie viel Luft zum Atmen noch übrig ist; „Runden, die noch passen“ sagt Ihnen, wie lange das Gespräch dauern kann, bevor Sie ältere Nachrichten kürzen oder zusammenfassen müssen. Da sich die Ausgabe auch innerhalb des Fensters befindet, verschlingt die Reservierung von 4.000 Token für eine lange Antwort den für den Kontext verfügbaren Platz, weshalb sich Aufgaben mit langer Ausgabe selbst bei Modellen mit großem Fenster beengt anfühlen.

Sobald Sie wissen, dass es passt, legen Sie den Preis fest. Der LLM-Token-Kostenrechner wandelt diese Token bei jedem Modell in Kosten pro Anruf um Prompt-Caching-Rechner zeigt, wie viel Sie sparen, indem Sie diese feste Systemaufforderung zwischenspeichern, anstatt sie erneut in Rechnung zu stellen Chatbot-Kostenrechner bindet alles an das monatliche Volumen.

Wie man es benutzt

1. Wählen Sie ein Modell aus – sein Kontextfenster wird automatisch geladen.
2. Geben Sie die Eingabeaufforderungsgröße Ihres Systems, die durchschnittlichen Token pro Nachricht und die Anzahl vergangener Runden ein, die Sie im Verlauf speichern.
3. Reservieren Sie Token für die Antwort des Modells (längere Antworten erfordern mehr).
4. Lesen Sie den verwendeten Prozentsatz, die noch passenden Windungen und die Kosten ab und vergleichen Sie dann die Modelle in der Tabelle.

Häufige Fehler

Das Vergessen der Leistung zählt. Die Antwort teilt das Fenster mit der Eingabe; einen großen reservieren max_tokens verkleinert den Kontext, den Sie übergeben können. Alles für immer erneut verschicken. Der Hauptgrund dafür, dass die Chat-Kosten in die Höhe schießen, ist die ständig neue Abrechnung einer wachsenden Historie – fassen Sie die Historie zusammen oder fenstern Sie sie. Vertrauensvolle Worte zählen. Token sind keine Worte; Code, JSON und nicht-englischer Text verwenden weitaus mehr Token pro Zeichen. Verwirrendes Fenster mit Kosten. Die Nutzung eines 1-Millionen-Fensters ist kostenlos, das Füllen bei jedem Anruf ist jedoch teuer.

FAQ

Was ist der Unterschied zwischen Kontextfenster und maximaler Ausgabe?

Das Fenster zeigt das Gesamtbudget für Input + Output zusammen. max_tokens begrenzt nur die Ausgabe, und diese Ausgabe wird aus demselben Fenster herausgeschnitten – sie tauschen sich also gegeneinander aus.

Wie schätze ich Token ohne Tokenizer?

Ungefähr 1 Token ≈ 0,75 englische Wörter oder ~4 Zeichen. Für genaue Zählungen fügen Sie Ihren Text in das ein Token-Zähler. Code und nicht-englischer Text werden höher angezeigt.

Was passiert, wenn ich das Fenster überschreite?

Abhängig vom Anbieter und Ihrer Einrichtung lehnt die API die Anfrage entweder ab oder schneidet die ältesten Nachrichten stillschweigend ab. So oder so verliert das Modell den Anfang des Gesprächs – schneiden Sie es ab oder fassen Sie es zusammen, bevor Sie das Limit erreichen.

Macht ein größeres Fenster das Modell intelligenter?

Nein – es enthält nur mehr Text. Modelle kümmern sich häufig weniger zuverlässig um die Mitte eines sehr langen Kontexts, sodass eine fokussierte, gekürzte Eingabeaufforderung häufig eine überfüllte Eingabeaufforderung übertrifft.

Nur Schätzung. Token-Anzahl, Kontextfenster und Preise sind Referenzwerte und variieren je nach Modell und Anbieter – überprüfen Sie diese, bevor Sie sich darauf verlassen.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
AI Wrapper-PreiseChatbot-KostenrechnerKostenrechner für KI-AgentenAgentenschleifenbudget (P99)Kosten für die Migration von LLM-Anbietern