So funktioniert dieser Rechner
Der Blended LLM-Preisrechner berechnet die tatsächlichen Kosten eines einzelnen API-Aufrufs und die effektive Rate pro 1 Mio. Token Dies ergibt sich aus der Mischung von Eingabe- und Ausgabe-Tokens. Sie geben vier Werte ein: die des Modells Eingabepreis pro 1 Mio. Token, es ist Ausgabepreis pro 1 Mio. Token, und die pro Aufruf verwendete Eingabe- und Ausgabetoken. Das Tool multipliziert jede Token-Anzahl mit ihrer Matching-Rate und addiert beides, sodass die Kosten pro Anruf sowohl von den veröffentlichten Preisen als auch von Ihrem tatsächlichen Token-Mix bestimmt werden. Da Ausgabe-Tokens in der Regel ein Vielfaches teurer sind als Eingabe-Tokens, kann ein Aufruf, der viel generierten Text enthält, weitaus mehr kosten, als die Eingabelänge allein vermuten lässt.
Der Pauschalpreis ist wichtig, da ein einzelner Aufkleberpreis verbirgt, was Sie tatsächlich zahlen werden. Ein Modell mit billigem Input, aber teurem Output kann im Nachhinein teurer sein als ein Konkurrenzmodell echtes Token-Verhältnis angewendet wird. Der praktische Tipp: Ordnen Sie die Token-Anzahl einem repräsentativen Anruf und nicht einem Best-Case zu und vergleichen Sie dann die Modelle gemischter Satz pro 1 Mio anstelle des Headline-Eingabepreises. Beobachten Sie die Ausgabeseite am genauesten – das Kürzen ausführlicherer Antworten oder das Begrenzen der Ausgabelänge senkt oft die Kosten mehr als das Verkleinern der Eingabeaufforderung.
Häufig gestellte Fragen
Warum ist Output teurer als Input?
Das Generieren von Token ist rechenintensiver als das Lesen, daher bepreisen Anbieter den Output etwa drei- bis fünfmal höher als den Input. Eine Eingabeaufforderung mit großem Kontext, aber einer kurzen Antwort kann immer noch von den wenigen teuren Ausgabe-Tokens dominiert werden – oder umgekehrt, abhängig von Ihrem Token-Mix.
Was ist ein gemischter Token-Preis?
Ihr tatsächlicher effektiver Ein- und Ausgabesatz wird danach gewichtet, wie viele davon Sie tatsächlich verwenden. Die angegebenen Preise werden aufgeteilt; Die gemischte Rate sagt Ihnen, was ein echter Anruf pro Token kostet. Diese Rate sollten Sie für Margin und Prognose verwenden.