HomeBlog › Kosten für den Inferenzhost im offenen Modell

Gleiches Modell, andere Rechnung: Was kosten Open-Weight-LLMs über 6 Inferenzhosts hinweg?

Veröffentlicht am 06.08.2026 · Referenznummern, vor der Budgetierung überprüfen

DeepSeek V4 ist DeepSeek V4. Die Gewichte sind identisch, unabhängig davon, ob Sie es durchrufen Groq, Zusammen, Feuerwerk, DeepInfra, Novita oder OpenRouter – gleiche Architektur, gleiche Ausgabequalität, kein Unterschied bei der Feinabstimmung zwischen Hosts. Was nicht identisch ist, ist die Rechnung. Wir haben unsere Preise pro 1 Mio. Token auf alle sechs für genau dasselbe Modell zweimal angepasst, und der Abstand zwischen den günstigsten und teuersten Host-Ländern ist gleich geblieben 31% – jedes Mal.

Die Arbeitsbelastung, die wir einkalkulieren

Ein mittelgroßes RAG oder Codierungsassistent-Backend, das ausgeführt wird DeepSeek V4: 50 Millionen Input-Tokens und 10 Millionen Output-Tokens pro Monat. Das ist ein echter Produktionsbereich – ein Support-Bot oder ein internes Codierungstool mit ein paar hundert aktiven Benutzern, kein Spielzeugprojekt.

Schritt 1: DeepSeek V4, sechs Hosts

GastgeberEingabe / 1MAusgabe / 1MMonatliche Kosten
Novita$0.216$0.88$19.60
DeepInfra$0.2295$0.935$20.83
Groq$0.2565$1.045$23.28
Zusammen$0.27$1.10$24.50
OpenRouter$0.27$1.10$24.50
Feuerwerk$0.2835$1.155$25.73

Bei den Preisen handelt es sich um Referenzschätzungen, August 2026. Veralteten Preis melden →

19,60 bis 25,73 US-Dollar für identische Gewichte bei identischer Verwendung – a 6,13 $/Monat, 31 % Lücke ohne Qualitätsunterschied, um es zu erklären. Bei 10-facher Lautstärke (500 MB Eingang / 100 MB Ausgang, ein wirklich ausgelastetes Produkt). 196 $ gegenüber 257 $, A 735 $/Jahr Unterschied zum Host-Dropdown allein.

Schritt 2: Llama 4 Maverick, dieselben sechs Hosts

Um zu überprüfen, dass dies keine DeepSeek-Eigenart war, haben wir dieselben sechs Hosts gegen Llama 4 Maverick mit derselben 50M/10M-Workload ausgeführt:

GastgeberEingabe / 1MAusgabe / 1MMonatliche Kosten
Novita$0.28$0.92$23.20
DeepInfra$0.2975$0.9775$24.65
Groq$0.3325$1.0925$27.55
Zusammen$0.35$1.15$29.00
OpenRouter$0.35$1.15$29.00
Feuerwerk$0.3675$1.2075$30.45

Gleicher Rang, gleiche Reihenfolge, gleich 31 % Verbreitung von Novita unten bis Feuerwerk oben. Das ist kein Zufall – es handelt sich um einen festen Multiplikator, den jeder Host auf denselben Referenzpreis anwendet, und er gilt für jedes offene Modell, das wir in unserem Preissatz überprüft haben, von Gemma mit 12B-Parametern bis hin zu Llama 4 Behemoth mit mehr als 400B-Parametern.

Woher die 31 %-Bande kommt

Was Ihnen das nicht sagt

Preisparität zwischen den Modellen bedeutet nicht, dass die Hosts austauschbar sind. Wir vergleichen nur die Rate pro Token – nicht die Latenz, den Betriebszeitverlauf, die Regionsabdeckung, die Ratenbeschränkungen oder das Verhalten der einzelnen Hosts bei einem Traffic-Spitzenwert. Ein Rabatt von 20 % auf Novita ist nichts wert, wenn ein Support-Bot während Ihrer geschäftigsten Stunde ausfällt. Wenn Sie umsatzorientiert und kostensensibel sind, beginnen Sie mit dem günstigsten Host und einem Fallback. Wenn Sie bereits ein aussagekräftiges Volumen erreicht haben, vergleichen Sie Latenz und Betriebszeit mit Ihrem eigenen Datenverkehr, bevor Sie nur auf die Preisspalte umschalten – der Abstand von 735 US-Dollar/Jahr aus unserem Beispiel ist echtes Geld, aber es ist nicht die einzige Zahl, die zählt.

Das Essen zum Mitnehmen

Offenes Gewicht bedeutet nicht gleichbedeutend mit offener Preisgestaltung. Dass das Modell kostenlos heruntergeladen werden kann, hindert sechs verschiedene Unternehmen nicht daran, sechs verschiedene Tarife zu verlangen, um es für Sie zu betreiben, und die Spanne – 31 % von oben nach unten, in der gleichen Reihenfolge, bei jedem von uns überprüften Modell – ist groß genug, um eine Rolle zu spielen, sobald Sie mehr als ein paar Millionen Token pro Monat haben. Bevor Sie sich auf einen Host festlegen, führen Sie Ihr eigenes Token-Volume durch günstigstes LLM-API-Tool, und vergleichen Sie die Anbieter direkt auf ihren Seiten: Groq, Zusammen, Feuerwerk, OpenRouter. Es ist die gleiche Lektion wie die Grenzsteuer über alle Modellstufen hinweg: Der Modellname auf der Rechnung sagt weniger aus als das daneben stehende Herstellerlogo.

Bei den Zahlen handelt es sich um Referenzschätzungen (August 2026) aus unserem eigenen Preisdatensatz. Die Preise für Inference-Hosts ändern sich häufig und Mengenrabatte, Tarife für zugesicherte Nutzung und regionale Preise können die Rangfolge verschieben. Überprüfen Sie vor der Budgetierung immer die aktuellen Tarife auf der offiziellen Preisseite jedes Anbieters.