So funktioniert dieser Rechner
Der Zeit- und Kostenrechner für die Stapelverarbeitung schätzt zwei Dinge für einen Massen-LLM-Job: die Wanduhrzeit Es dauert, bis es fertig ist und das Gesamtkosten des Laufs. Es multipliziert Ihre Artikelanzahl mit den pro Artikel generierten Token, um das gesamte Token-Volumen zu erhalten, und wendet dann Ihren Preis pro 1 Mio. Token an, um den Dollarwert zu ermitteln. Die Laufzeit ergibt sich aus der Aufteilung dieser Token-Arbeit auf Ihre Worker: der Geschwindigkeit pro Worker in Tokens pro Sekunde und der Anzahl der Parallelarbeiter Zusammengesetzter Durchsatz, sodass eine höhere Parallelität die verstrichene Zeit verkürzt, auch wenn die Token-Rechnung gleich bleibt.
Der wichtigste Kompromiss besteht darin Parallelität spart Zeit, aber nicht Kosten. Durch die Verdoppelung der Arbeiter halbiert sich die Dauer der Arbeitszeit ungefähr, Sie zahlen aber trotzdem für jeden generierten Token. Überprüfen Sie vor der Skalierung, ob die Schätzung der Token pro Artikel realistisch ist Ausgabelänge ist der größte Zeit- und Ausgabenfaktor. Kürzen Sie zunächst ausführliche Ausgaben und erhöhen Sie dann die Anzahl der Mitarbeiter, um Ihre Frist einzuhalten.
Häufig gestellte Fragen
Wie kann ich abschätzen, wie lange ein LLM-Massenauftrag dauert?
Gesamtzahl der Token = Artikel × Token pro Artikel. Teilen Sie durch den kombinierten Durchsatz (Geschwindigkeit pro Arbeiter × Anzahl paralleler Arbeiter), um Sekunden in Sekundenschnelle zu erhalten. Zehn Arbeiter mit 60 Token/s liefern 600 Token/s, sodass ein 8-M-Token-Auftrag etwa 3,7 Stunden dauert – bevor Sie durch Ratenbeschränkungen gedrosselt werden.
Sollte ich stattdessen die Batch-API verwenden?
Wenn der Job nicht zeitkritisch ist, ja. Batch-Endpunkte (OpenAI, Anthropic, Gemini) führen Jobs asynchron innerhalb eines 24-Stunden-Fensters zum etwa halben Preis pro Token aus. Sie tauschen sofortige Latenz gegen einen großen Rabatt – ideal für Einbettungen, Backfills, Auswertungen und Offline-Anreicherung.