So funktioniert die LLM-API-Preisgestaltung

Tokens, Eingabe vs. Ausgabe, Kontextfenster – warum die gleiche Aufgabe bei einem Modell 50-mal mehr kosten kann als bei einem anderen, einfach erklärt.

HeimLernen › Die Batch-API: 50 % Rabatt für nicht dringende Aufträge

Die Batch-API: 50 % Rabatt für nicht dringende Aufträge

Die meisten Menschen rufen ein KI-Modell an und warten in Echtzeit auf eine Antwort. Ein großer Teil der KI-Arbeit ist jedoch überhaupt nicht dringend, sondern besteht aus der Erstellung von Berichten über Nacht, der Massenklassifizierung und der Kennzeichnung von Datensätzen. Für diese Aufgaben bieten Batch-APIs dieselben Modelle mit einem erheblichen Preisnachlass an, üblicherweise etwa 50 %, als Gegenleistung für den Verzicht auf sofortige Ergebnisse.

Was ist eine Batch-API?

Mit einer Batch-API können Sie viele Anfragen auf einmal als einen einzigen Auftrag übermitteln, statt einzeln in Echtzeit. Sie laden eine Datei mit allen Ihren Eingabeaufforderungen hoch, der Anbieter verarbeitet sie asynchron über einen bestimmten Zeitraum und Sie laden die Ergebnisse herunter, wenn sie fertig sind.

Der Handel, den Sie tätigen, ist einfach: Sie verzichten auf Geschwindigkeit und erhalten einen niedrigeren Preis. Anstelle einer Antwort innerhalb von Sekunden können Sie Minuten oder Stunden warten. Im Gegenzug werden die Kosten pro Token im Vergleich zum Standard-Synchrontarif in der Regel um etwa die Hälfte gesenkt.

Warum Anbieter den Rabatt anbieten können

Der Echtzeit-API-Verkehr ist spitzenmäßig und unvorhersehbar. Anbieter müssen freie Kapazitäten für Nachfragespitzen bereithalten, und dieser ungenutzte Spielraum ist teuer. Batch-Jobs sind flexibel: Sie können immer dann ausgeführt werden, wenn freie Kapazität vorhanden ist, wodurch die Auslastung ausgeglichen wird.

Da Sie dem Anbieter erlauben, Ihre Arbeit in ruhigere Zeiten zu planen, kann er die Hardware effizienter nutzen und einen Teil dieser Ersparnis an Sie zurückgeben. Bei dem Rabatt handelt es sich nicht um ein Modell mit geringerer Qualität, sondern um genau das gleiche Modell, das nach einem entspannten Zeitplan läuft.

Wie der Workflow aussieht

Der typische Batch-Ablauf besteht aus vier Schritten:

  • Bereiten Sie eine Datei vor Dabei ist jede Zeile eine Anfrage, normalerweise in einem strukturierten Format mit einer benutzerdefinierten ID, damit Sie die Ergebnisse wieder den Eingaben zuordnen können.
  • Senden Sie den Stapel und erhalten Sie eine Job-ID.
  • Umfrage zum Status während der Anbieter die Warteschlange abarbeitet, häufig mit einem angegebenen Fertigstellungsziel, beispielsweise innerhalb von 24 Stunden.
  • Rufen Sie die Ausgabedatei ab Sobald dies abgeschlossen ist, ordnen Sie jedes Ergebnis mithilfe der IDs wieder seiner Anforderung zu.

Ihre Anwendungslogik ändert sich kaum, es werden dieselben Eingabeaufforderungen und dieselben Modelle verwendet. Was sich ändert, ist, dass Sie nicht jede Antwort blockieren.

Welche Jobs passen zum Batch-Modell?

Batch ist ideal, wenn ein Mensch nicht auf die Antwort wartet:

  • Massenklassifizierung oder Tagging großer Datensätze.
  • Content-Generierung für Kataloge, Produktbeschreibungen oder vorab erstellte Zusammenfassungen.
  • Datenextraktion aus großen Dokumentensammlungen.
  • Auswertungen und Backtesting Hier führen Sie eine Eingabeaufforderung über Tausende von Testfällen aus.
  • Einbettungen Generation für einen ganzen Korpus auf einmal.

Es eignet sich schlecht für alles Interaktive: Chatbots, Live-Suche oder jede Funktion, bei der ein Benutzer auf einen Lade-Spinner starrt.

Die Ökonomie des Wartens

Über die Ersparnis lässt sich leicht nachdenken. Wenn ein Auftrag zum Standardtarif 200 US-Dollar kosten würde und der Mengenrabatt 50 % beträgt, kostet er bei identischer Ausgabe stattdessen 100 US-Dollar. Bei großen wiederkehrenden Arbeitslasten verschärft sich dieser Unterschied von Monat zu Monat.

Hier ist ein ausgearbeitetes Beispiel mit veranschaulichenden Tarifen, damit die Mathematik konkret bleibt. Die Klassifizierung von 1 Million Kurzdokumenten mit jeweils 500 Eingabe- und 20 Ausgabe-Tokens ergibt insgesamt 500 Millionen Eingabe-Tokens und 20 Millionen Ausgabe-Tokens. Bei einem beispielhaften Preis von 0,15 $ pro 1 Million Eingabe-Tokens und 0,60 $ pro 1 Million Ausgabe-Tokens beträgt die synchrone Preisgestaltung etwa 75 $ + 12 $ = 87 $ für den gesamten Auftrag. Derselbe Auftrag über den Batch-Endpunkt zum halben Preis reduziert diesen Wert auf etwa 43,50 US-Dollar – eine Ersparnis von 43,50 US-Dollar bei einem einzigen Durchlauf, bevor Sie den Durchlauf für den nächsten Monat überhaupt mitzählen. Mit dem LLM-Kostenrechner können Sie Ihre eigene Token-Anzahl und Ihr eigenes Token-Volumen eingeben und dann die Gesamtsumme halbieren, um eine Vorschau des Batch-Szenarios im Vergleich zum Echtzeit-Szenario unter Verwendung der aktuellen Anbietertarife anzuzeigen.

Dinge, auf die man achten sollte

Ein paar praktische Vorbehalte. Fertigstellungszeiten sind Zielvorgaben und keine Garantien. Bauen Sie Ihre Pipeline daher so auf, dass variable Verzögerungen toleriert werden. Für sehr große Stapel können Größen- oder Ratenbeschränkungen gelten, sodass Sie möglicherweise große Aufträge in Abschnitte aufteilen müssen. Und Sie zahlen weiterhin sowohl für Eingabe- als auch Ausgabe-Tokens. Der Rabatt gilt für den Preis und nicht für die Anzahl der Tokens, sodass schnelle Effizienz immer noch wichtig ist.

Fehlgeschlagene Anfragen innerhalb eines Batches werden normalerweise nicht in Rechnung gestellt. Wenn eine Zeile in Ihrer Eingabedatei fehlerhaft ist oder eine einzelne Anfrage fehlerhaft ist, berechnen die Anbieter im Allgemeinen nur die tatsächlich abgeschlossenen Anfragen, nicht die fehlgeschlagenen. Das bedeutet, dass eine Handvoll fehlerhafter Zeilen den Rabatt auf den Rest des Auftrags nicht zunichte machen, aber es bedeutet auch, dass Ihre Ausgabedatei mit Ihren Eingabe-IDs verglichen werden muss, um zu sehen, welche Anfragen Sie erneut übermitteln müssen.

Überprüfen Sie abschließend die Besonderheiten jedes Anbieters auf den /models-Seiten, da der genaue Rabatt, das Bearbeitungsziel und die unterstützten Funktionen (z. B. ob Caching oder Tools im Batch funktionieren) von Anbieter zu Anbieter unterschiedlich sind.

Häufig gestellte Fragen

Ist die Batch-API ein schwächeres Modell?

Nein. Sie erhalten das gleiche Modell und die gleiche Ausgabequalität wie die Echtzeit-API. Der einzige Unterschied besteht darin, dass die Ergebnisse später eintreffen, weshalb der Preis niedriger ist.

Wie lange dauert ein Batch-Job?

Anbieter geben in der Regel ein Fertigstellungsziel an, z. B. innerhalb von 24 Stunden, und viele Aufträge werden viel schneller abgeschlossen, wenn Kapazität verfügbar ist. Es ist nicht sofort verfügbar, also verwenden Sie es nur, wenn niemand auf die Antwort wartet.

Wie viel sparen Batch-APIs normalerweise?

Etwa 50 % Rabatt auf den Standardpreis pro Token sind bei großen Anbietern üblich und gelten sowohl für Eingabe- als auch für Ausgabe-Tokens. Bestätigen Sie immer den aktuellen Rabatt für Ihren spezifischen Anbieter und Ihr Modell.

Zahle ich für Anfragen, die innerhalb eines Batches fehlschlagen?

Generell nein. Providers typically only bill for the requests in a batch that actually completed successfully, so a malformed prompt or an occasional error does not cost you the discount on the rest of the job. You still need to check the output file against your submitted IDs to see which requests failed and resubmit them.

Nur zu Bildungszwecken – keine Finanzberatung.

Tools & Hosting

📈 TradingView🔒 NordVPN💳 RevolutDigitalOcean $200Hostinger