echte monatliche Gesamtkosten
naive Pauschalschätzung
versteckte Zuschlagsbelastung
Einsparungen, wenn lange Anfragen gekürzt werden
Zuschlagsbelichtung

Kostenaufschlüsselung nach Ihrem Arbeitsaufwand

Bei kurzfristigen Anfragen gilt in der Regel der Basispreis; Bei langen Anfragen wird für den GESAMTEN Anruf – Ein- und Ausgabe – der höhere Klippenpreis berechnet. Die naive Zeile zeigt, was eine Pauschalschätzung voraussetzen würde, und die gekürzte Zeile zeigt das Szenario, in dem lange Anfragen auf knapp unter den Schwellenwert komprimiert werden.

ReiheAnfragenKosten/AnfrageZwischensumme

Gemischte Kosten pro Anteil langer Anfragen

Alles andere wird auf den oben genannten Werten gehalten und über den Anteil der Anfragen verteilt, die über dem Schwellenwert landen. Die hervorgehobene Zeile kommt Ihrer aktuellen Einstellung am nächsten.

Überschwelliger AnteilTatsächliche KostenNaive SchätzungZuschlag

Wie dies mit anderen Tools verbunden ist

Dieser Rechner bewertet einen bestimmten Mechanismus: einen harten Längenschwellenwert, bei dessen Überschreiten eine gesamte Anfrage neu bewertet wird, nicht nur die Token über der Linie. Das ist anders als bei uns Kostenrechner für Kontextfenster, das glatte, flache Kosten pro Token nach Kontextgröße modelliert und überhaupt keine Klippen- oder Schwellenwertlogik aufweist – verwenden Sie dieses Tool, wenn das Modell, für das Sie einen Preis festlegen, unabhängig von der Anfragelänge den gleichen Preis berechnet. Es ist auch anders als das Preisrechner für LLM-Stufen Und LLM-Servicestufenrechner, welche latenzbasierten Servicestufen Batch/Flex/Priorität kosten – eine Entscheidung, die Sie pro Anfrage darüber treffen, wie schnell Sie eine Antwort benötigen, und keine Konsequenz davon, wie lange Ihre Aufforderung dauert. Wenn Sie allgemeine Gemini-Preise für alle Modellgrößen ohne isolierte Klippenmechanik wünschen, sehen Sie sich die an Gemini API-Kostenrechner. Diese Seite existiert, weil eine pauschale Pro-Token-Ansicht des Schlagzeilenpreises von Gemini 2.5 Pro von 1,25 US-Dollar die tatsächlichen Kosten völlig verfehlt, sobald ein Teil einer Arbeitslast 200.000 Eingabe-Token überschreitet.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS