Glossar zu KI- und API-Kosten

Jeder Begriff, den Sie auf einer Preisseite finden – Token, Kontextfenster, Ratenlimits, Inferenz, Gutschriften, Gesamtbetriebskosten – wird in einem oder zwei einfachen englischen Sätzen definiert.

HeimLernen › Glossar zu KI- und API-Kosten

So verwenden Sie dieses Glossar

Die API- und AI-Preisseiten sind voll von Fachjargon, der verbirgt, was Sie tatsächlich bezahlen werden. Nachfolgend finden Sie die 40 häufigsten Begriffe, gruppiert in: LLM-Preise und Token, Infrastruktur & Selbsthosting, Und Abrechnungsmodelle. Jede Definition ist herstellerneutral und auf den Kostenaspekt ausgerichtet. Neu bei der LLM-Abrechnung? Beginnen Sie mit unserem So funktioniert die LLM-API-Preisgestaltung Leitfaden, dann schätzen Sie eine reelle Zahl mit dem Token-Kostenrechner.

Token-Kostenrechner →Alle Learn-Anleitungen →

LLM-Preise und Token

Token
Die kleine Texteinheit, die ein LLM liest und schreibt – auf Englisch etwa ¾ eines Wortes oder etwa 4 Zeichen. Die Abrechnung erfolgt pro Token, daher bestimmt die Anzahl der Token (nicht die Anzahl der Anfragen) Ihre LLM-Rechnung.
Eingabe-Tokens
The tokens you send to the model: your prompt, system instructions, conversation history and any attached context. Sie sind in der Regel die günstigeren Tarife, vervielfachen sich jedoch schnell, wenn Sie den Kontext bei jedem Anruf erneut senden.
Ausgabetoken
Die Token, die das Modell in seiner Antwort generiert. Der Ausgabepreis ist fast immer höher als der Eingabepreis – in der Regel 3–5x –, da das Generieren von Text mehr Rechenleistung kostet als das Lesen.
Kontextfenster
Die maximale Anzahl an Token, die ein Modell gleichzeitig berücksichtigen kann (z. B. 128.000 oder 1 Mio.). Es handelt sich um eine Kapazitätsgrenze, nicht um freien Speicherplatz: Jeder Token, den Sie in das Fenster legen, wird bei jedem Anruf in Rechnung gestellt.
Kosten pro Million Token
Die Standard-LLM-Einheitspreise werden in ($/1 Mio. Token) angegeben und separat für Eingabe und Ausgabe aufgeführt. Die schnellste Möglichkeit, die Ausgaben abzuschätzen, ist die Multiplikation Ihres monatlichen Token-Volumens mit diesen Raten.
Sofortiges Caching
Speichern eines wiederholten Eingabeaufforderungspräfixes – einer langen Systemnachricht oder eines langen Systemdokuments – damit es nicht bei jedem Anruf erneut verarbeitet wird. Zwischengespeicherte Eingaben werden mit einem erheblichen Rabatt (oft 75–90 % Rabatt) in Rechnung gestellt, wodurch die Kosten für sich wiederholende Arbeitslasten gesenkt werden.
Argumentationsmarken
Die versteckten „Denk“-Tokens, die manche Modelle vor ihrer sichtbaren Antwort generieren. Sie sehen sie nicht, aber sie werden als Ausgabe abgerechnet – ein wichtiger und leicht zu übersehender Kostenfaktor bei Reasoning-Modellen.
Multimodale Token
Bilder, Audio und Video werden zur Abrechnung in Token-Äquivalente umgewandelt. Ein einzelnes hochauflösendes Bild kann Hunderte oder Tausende von Eingabetokens kosten, sodass sich multimodale Eingabeaufforderungen schneller summieren als nur Text.
Gemischter Tarif
Ein einzelner Durchschnittspreis pro Token, der Eingabe- und Ausgaberaten entsprechend Ihrer typischen Mischung kombiniert. Nützlich für schnelle Schätzungen, verbirgt jedoch, dass der Output die teure Hälfte der Rechnung ausmacht.
Batch-API
Ein asynchroner Endpunkt, der große Aufträge innerhalb eines Verzögerungsfensters (oft bis zu 24 Stunden) gegen einen Rabatt von üblicherweise etwa 50 % verarbeitet. Ideal für nicht dringende Arbeiten wie Massenklassifizierung oder Einbettungen.
Einbettungen
Numerische Vektoren, die die Bedeutung von Text, Bildern oder anderen Daten darstellen, sodass sie nach Ähnlichkeit durchsucht werden können. Sie lassen sich kostengünstig pro Token generieren und unterstützen die semantische Suche und RAG.
Feinabstimmung
Trainieren Sie ein Basismodell anhand Ihrer eigenen Beispiele weiter, um sein Verhalten zu spezialisieren. Dadurch fallen vorab Schulungskosten an und bei gehosteten Modellen ist die Inferenzrate pro Token häufig höher als beim Basismodell.
RAG (Retrieval-Augmented Generation)
Ein Muster, das nur die relevanten Ausschnitte aus einer Wissensdatenbank abruft und sie der Eingabeaufforderung hinzufügt, anstatt ganze Dokumente in den Kontext zu stopfen. Es kürzt Eingabetokens und sorgt dafür, dass die Antworten in Ihren Daten verankert bleiben.
Modellstufe (Flaggschiff / Mittelklasse / Nano)
Anbieter bieten Modellfamilien auf unterschiedlichen Leistungs- und Preisniveaus an – Flaggschiff (am leistungsfähigsten, am teuersten), Mittelklasse (ausgewogen) und Nano/Klein (am günstigsten, am schnellsten). Die Anpassung der Stufe an den Schwierigkeitsgrad der Aufgabe ist der größte Kostenhebel.
Temperatur
Eine Einstellung von 0 bis etwa 2, die die Zufälligkeit der Ausgabe steuert. Es beeinflusst den Antwortstil und nicht direkt den Preis, aber höhere Werte können zu längeren oder vielfältigeren Antworten führen, die die Ausgabe-Token-Kosten verschieben.
Funktions-/Werkzeugaufruf
Lassen Sie das Modell eine strukturierte Anfrage zurückgeben, um eines Ihrer definierten Tools oder APIs auszuführen. Die Tool-Definitionen werden bei jedem Aufruf als Eingabe-Token gesendet, und mehrstufige Tool-Schleifen vervielfachen die gesamte Token-Nutzung.
Streaming
Bereitstellung der Ausgabe des Modells Token für Token bei der Generierung und nicht in einem Block. Es verbessert die wahrgenommene Geschwindigkeit und verkürzt die Zeit bis zum ersten Token, ändert jedoch nicht den Gesamtpreis des Tokens.
Destillation
Trainieren Sie ein kleineres „Schüler“-Modell, um ein größeres „Lehrer“-Modell nachzuahmen. Das Ergebnis ist pro Token weitaus günstiger, während ein Großteil der Qualität bei einer bestimmten Reihe von Aufgaben erhalten bleibt.
Quantisierung
Reduzieren der numerischen Präzision der Gewichte eines Modells (z. B. von 16 Bit auf 4 Bit), sodass es weniger Speicher benötigt und schneller läuft. Für Selbsthoster senkt dies die GPU-Kosten, normalerweise mit einem kleinen Kompromiss bei der Qualität.
Schlussfolgerung
Ausführen eines trainierten Modells, um eine Ausgabe zu erzeugen – der Vorgang, für den Sie bei jedem API-Aufruf bezahlen. Die Inferenzkosten skalieren mit Token auf gehosteten APIs und mit der Rechenzeit auf selbst gehosteten GPUs.

Infrastruktur und Selbsthosting

Geschwindigkeitsbegrenzung (U/min/TPM)
Die Obergrenzen, die ein Anbieter pro Konto durchsetzt: RPM sind Anfragen pro Minute, TPM sind Tokens pro Minute. Bei Überschreitung wird ein 429-Fehler zurückgegeben, sodass für die Skalierung Batchverarbeitung, Warteschlangenverarbeitung oder eine höhere Stufe erforderlich ist.
Parallelitätslimit
Die maximale Anzahl von Anfragen, die gleichzeitig im Flug zulässig sind. Es begrenzt die Anzahl der parallelen Jobs, die Sie ausführen können, und legt bei selbst gehosteten oder bereitgestellten Setups direkt die Größe der Hardware fest, für die Sie bezahlen müssen.
TTFT / Latenz
TTFT (Time-to-First-Token) gibt an, wie lange es dauert, bis das erste Ausgabe-Token eintrifft. Latenz ist die Gesamtantwortzeit. Sie prägen das Benutzererlebnis und bei gemieteten GPUs bedeutet eine längere Latenz, dass mehr Rechenleistung pro Anfrage abgerechnet wird.
Durchsatz
Wie viele Token oder Anfragen verarbeitet ein System pro Sekunde? Ein höherer Durchsatz bedient mehr Benutzer auf derselben Hardware und senkt die Kosten pro Anfrage, wenn Sie selbst hosten oder Kapazität reservieren.
Vektordatenbank
Ein Shop, der für die Speicherung von Einbettungen und deren Suche nach Ähnlichkeit optimiert ist. Es unterstützt RAG und semantische Suche und wird in der Regel nach gespeicherten Vektoren, Dimensionen und Abfragen und nicht nach Token berechnet.
GPU / VRAM
Der Grafikprozessor und sein Videospeicher, die die Modellinferenz ausführen. Ein Modell muss zum Laden in den VRAM passen, daher erfordern größere Modelle teurere GPUs mit mehr Speicher – die Hauptkosten des Selbsthostings.
Selbsthosting
Führen Sie ein Open-Weight-Modell auf Ihrer eigenen oder gemieteten Hardware aus, anstatt eine gehostete API aufzurufen. Dadurch entfallen die Gebühren pro Token, es kommen jedoch feste GPU-, Engineering- und Leerkapazitätskosten hinzu, die sich nur bei hohem Volumen auszahlen.
Ausgehender Datenverkehr/Bandbreite
Die Gebühr für Daten, die das Netzwerk eines Cloud-Anbieters verlassen. Bei KI-Budgets kann man leicht vergessen, dass Ausgangsgebühren erheblich sein können, wenn große Datensätze, Medien oder Modellgewichte zwischen Diensten oder Regionen verschoben werden.
Kaltstart (serverlos)
Die Verzögerung, wenn eine serverlose Funktion oder ein Modellcontainer aus dem Leerlauf hochfährt, bevor er antworten kann. Es erhöht die Latenz und kann Sie bei großen Modellen mit langen Ladezeiten zu einer immer warmen Kapazität führen, die mehr kostet.
Bereitgestellter Durchsatz
Reservieren Sie eine feste, garantierte Menge an Modellkapazität für eine pauschale stündliche oder monatliche Gebühr, anstatt pro Token zu zahlen. Es stabilisiert Kosten und Latenz für einen stabilen Datenverkehr mit hohem Datenaufkommen, verschwendet jedoch Geld, wenn es nicht genutzt wird.
Spot vs. On-Demand
On-Demand-Instanzen sind jederzeit zum vollen Preis verfügbar; Spot-Instanzen (auf Abruf) nutzen freie Kapazität zu einem erheblichen Preisnachlass, können aber ohne Vorankündigung zurückgefordert werden. Spot eignet sich für unterbrechbare Batch-Jobs, nicht für latenzkritische Bereitstellungen.
Zugesicherte Nutzung/reservierte Kapazität
Ein Rabatt als Gegenleistung für die Verpflichtung zu Mindestausgaben oder bestimmter Hardware über einen Zeitraum von ein bis drei Jahren. Es senkt die effektive Rate für vorhersehbare Arbeitslasten, bindet Sie jedoch an die Belastung.
SLA (Verfügbarkeit)
Ein Service-Level-Agreement ist die vertragliche Zusage des Anbieters über die Verfügbarkeit (z. B. 99,9 %) und die geschuldeten Gutschriften bei Nichterfüllung. Höhere SLA-Stufen kosten normalerweise mehr, sind aber für die Produktionszuverlässigkeit von Bedeutung.

Abrechnungs- und Preismodelle

Preise pro Sitzplatz vs. nutzungsbasierte Preise
Pro Sitzplatz wird für jeden Benutzer unabhängig von der Aktivität eine Pauschalgebühr erhoben. nutzungsbasierte Gebühren für das, was Sie tatsächlich verbrauchen (Tokens, Anrufe, Rechenleistung). Sitzplätze sind vorhersehbar; Die Nutzung skaliert mit der Nachfrage und kann unerwartet ansteigen.
Credits
Prepaid-Guthaben, das Sie kaufen und abheben, wenn Sie einen Dienst nutzen. Credits ermöglichen eine reibungslose Abrechnung, können jedoch ablaufen, und ihr Wert pro Einheit verschleiert manchmal den tatsächlichen Preis pro Token oder pro Anruf.
Überschuss
Nutzung, die über das in Ihrem Plan enthaltene Kontingent hinausgeht, wird zu einem separaten – oft höheren – Tarif abgerechnet. Überschreitungsgebühren sind eine häufige Quelle überraschender Rechnungen, wenn der Datenverkehr das von Ihnen angemeldete Kontingent überschreitet.
Kostenloses Kontingent
Eine kostenlose Vergütung (ein monatliches Guthaben, begrenzte Anrufe oder ein Testfenster), mit der Sie einen Service testen können. Es ist zum Testen nützlich, reicht aber selten für die Produktion aus, und es gelten Grenzwerte oder Ablaufdaten.
TCO (Gesamtbetriebskosten)
Die vollen Kosten für den Betrieb einer Lösung – nicht nur API- oder GPU-Gebühren, sondern auch Technik, Überwachung, Speicherung, Ausgang und Overhead. Der Vergleich von gehosteten und selbst gehosteten Lösungen macht nur im Hinblick auf die Gesamtbetriebskosten (TCO) und nicht auf die Gesamtkosten Sinn.
Kosten pro Benutzer
Ihre gesamten KI- oder API-Ausgaben geteilt durch aktive Benutzer. Es wandelt die Rohnutzung in eine wirtschaftliche Einheit um, die Sie mit dem Umsatz oder dem Abonnementpreis vergleichen können, um zu prüfen, ob eine Funktion profitabel ist.
Gateway-/Router-Markup
Die Gebühr, die ein KI-Gateway oder Modell-Router zusätzlich zum Preis des zugrunde liegenden Anbieters für Routing, Fallback, Analysen oder einheitliche Abrechnung erhebt. Praktisch, aber der Aufschlag kann Ihre effektiven Kosten pro Token deutlich erhöhen.

Häufig gestellte Fragen

Was ist ein Token?

Ein Token ist der kleine Textblock, den ein LLM liest und generiert – im Englischen etwa drei Viertel eines Wortes oder etwa vier Zeichen. Anbieter rechnen pro Token sowohl für den von Ihnen gesendeten Text (Eingabe) als auch für den vom Modell erzeugten Text (Ausgabe) ab. Aus diesem Grund ist die LLM-Rechnung auf die Anzahl der Token und nicht auf die Anzahl der Anfragen zurückzuführen.

Was ist Prompt-Caching?

Durch Prompt-Caching kann ein Anbieter ein wiederholtes Präfix speichern – beispielsweise eine lange Systemaufforderung oder ein langes Dokument –, sodass es nicht bei jedem Anruf erneut verarbeitet wird. Zwischengespeicherte Eingabetokens werden mit einem großen Rabatt (oft 75–90 %) in Rechnung gestellt, wodurch die Kosten für Arbeitslasten gesenkt werden, die denselben Kontext erneut senden.

Was bedeuten TPM und RPM bei einem Ratenlimit?

RPM sind Anfragen pro Minute und TPM sind Tokens pro Minute – die beiden Obergrenzen, die ein Anbieter für Ihr Konto durchsetzt. Wenn Sie auf eines dieser beiden Elemente klicken, wird der Fehler 429 zurückgegeben. Anwendungen mit hohem Volumen müssen also gebündelt, in die Warteschlange gestellt oder eine höhere Stufe anfordern, anstatt von einem unbegrenzten Durchsatz auszugehen.

Nur als Referenz für Bildungszwecke – Preisbedingungen und Rabatte variieren je nach Anbieter; Überprüfen Sie die aktuellen Details auf der Preisseite jedes Anbieters.