7. September 2026 · KI & LLMs · 5 Minuten Lesezeit
Ich habe einen Fast-Inference-Anbieter für einen Agenten-Workload mit einem offenen Modell der 70B-Klasse ausgepreist, und die drei Namen, die immer wieder auftauchen – Groq, Together AI, Fireworks – bieten alle Preise pro Token an, die auf den ersten Blick ähnlich aussehen. Das ist es nicht. Bei Modellen der Llama-70B-Klasse funktioniert Groq 0,59 $ Input / 0,79 $ Output pro 1 Mio. Token, Together AI ist eine Wohnung $0.88 / $0.88, und Feuerwerksrechnungen sind gemischt ~0,90 $ pro 1 Mio für die Stufe 16–80B. Bei einer realistischen 70/30-Eingangs-/Ausgangsaufteilung ist das ein Lücke von 250 $ pro Monat zwischen Groq und Fireworks, wenn man eine Milliarde Token verkauft – und der billigste ist nicht automatisch die richtige Wahl.
Alle drei führen Open-Weight-Modelle – Llama, Qwen, Mixtral, DeepSeek – hinter OpenAI-kompatiblen APIs aus, sodass ein Anbieterwechsel in der Regel eine Änderung der Basis-URL erfordert. Hier erfahren Sie, was die Inferenz der Llama-70B-Klasse jeweils tatsächlich kostet, entnommen aus den jeweiligen Preisseiten:
| Anbieter | Modell | Geben Sie 1 Mio. $ ein | Ausgabe $/1 Mio |
|---|---|---|---|
| Groq | Lama 3,3 70B | $0.59 | $0.79 |
| Gemeinsam KI | Lama 3.1 70B | $0.88 | $0.88 |
| Feuerwerk | Mittelklasse (16–80B, z. B. Llama 70B) | ~0,90 $ gemischt | |
Groq ist auf dem Papier das günstigste für eine typische chatförmige Arbeitslast – mehr Input-Tokens als Output –, da sein Input-Preis 33 % unter dem Pauschalpreis von Together liegt. Zusammengenommen bepreist KI Eingabe und Ausgabe identisch, was einfacher zu prognostizieren ist, aber bei den eingabeintensiven Eingabeaufforderungen, die die meisten RAG- und Agenten-Workloads tatsächlich senden, mehr kostet. Fireworks trennt Eingabe/Ausgabe überhaupt nicht; Bei ca. 0,90 US-Dollar handelt es sich um einen einzigen gemischten Preis für die gesamte 16–80B-Modellklasse. Dies erleichtert die Schätzung, bedeutet aber, dass Sie nicht wie bei Groq oder Together eine Optimierung durch Verkleinern der Ausgabelänge durchführen können.
Der niedrigere Preis von Groq ist auf die gleiche Geschwindigkeit zurückzuführen: benutzerdefinierte LPU-Hardware (Language Processing Unit), die speziell für die Token-Generierung entwickelt wurde, anstelle von Allzweck-GPUs. Das ist auch das eigentliche Verkaufsargument von Groq gegenüber den anderen beiden – Hunderte von Token pro Sekunde, weit über dem, was H100-basierte Dienste normalerweise liefern. Für einen Sprachagenten oder eine Chat-Benutzeroberfläche, bei der der Benutzer den Cursor beobachtet, ist dieser Latenzunterschied wichtiger als die Lücke von 0,29 $/1 Mio. bei den Eingabetokens. Der Haken: Der gehostete Modellkatalog von Groq ist schmaler als der von Together oder Fireworks und bietet keine dedizierte Kapazität oder Feinabstimmung – wenn das von Ihnen benötigte Modell nicht auf der Liste von Groq steht, ist der Preis nicht mehr der entscheidende Faktor.
Together AI verfügt über den umfangreichsten offenen Modellkatalog der drei (Llama, Mixtral, Qwen, DeepSeek und mehr) sowie Feinabstimmung und dedizierte Endpunkte. Wenn es also darum geht, „meine eigene, fein abgestimmte Variante auszuführen“ statt „ein Standardmodell zu nennen“, gewinnen die flachen, leicht vorhersehbaren Preise und Tools von Together gegenüber der engeren, auf Geschwindigkeit ausgerichteten Produktpalette von Groq. Fireworks befindet sich in einer ähnlichen Position – serverlose Preise pro Token für schnelle Starts, aber auch dedizierte Bereitstellung pro GPU-Stunde für Teams, die reservierten Durchsatz und vorhersehbare Latenz in großem Maßstab wünschen, was weder der feste Katalog von Groq noch das Serverless-First-Setup von Together in gleicher Weise abdecken. Beide sind die bessere Standardeinstellung, wenn die Arbeitslast mehr als „günstigste Token für ein unterstütztes Modell“ benötigt.
Unter der Annahme einer realistischen Aufteilung von 70 % Eingabe/30 % Ausgabe, typisch für Chat- und RAG-Eingabeaufforderungen:
| Tokens/Monat | Groq | Gemeinsam KI | Feuerwerk |
|---|---|---|---|
| 10 Millionen (kleine App) | $6.50 | $8.80 | $9.00 |
| 100 Millionen (stabiles Produkt) | $65 | $88 | $90 |
| 1 Milliarde (Hochdurchsatzagent) | $650 | $880 | $900 |
Die Lücke skaliert linear mit dem Volumen, da es sich bei allen drei um reine Preise pro Token handelt, ohne Planuntergrenzen oder -stufen im Modell selbst – bei 1 Milliarde Token pro Monat sind die 650 US-Dollar von Groq gegenüber den 900 US-Dollar von Fireworks eine echte Differenz von 250 US-Dollar und kein Rundungsfehler. Aber keine dieser Zahlen berücksichtigt, was passiert, wenn das von Ihnen gewünschte Modell nicht beim günstigeren Anbieter verfügbar ist oder wenn die Geschwindigkeit von Groq Ihre effektiven Kosten an anderer Stelle senkt – weniger Wiederholungsversuche, kürzere Benutzersitzungen, weniger aggressives Cachen, nur um die Latenz zu verbergen.
Latenzempfindliches Produkt (Sprache, Live-Chat, alles, was ein Benutzer beim Streamen anstarrt): Beginnen Sie mit Groq, wenn Ihr Modell auf der Liste steht – die Geschwindigkeit ist die eigentliche Produktentscheidung, und es ist zufällig auch günstiger. Benötigen Sie ein fein abgestimmtes oder weniger verbreitetes offenes Modell oder möchten Sie dedizierte Kapazität mit vorhersehbarem Durchsatz: Together AI oder Fireworks, und wählen Sie je nachdem, ob Sie den breiteren Katalog von Together oder die dedizierte GPU-Stunden-Option von Fireworks mehr schätzen. Es ist auch nicht unvernünftig, alle drei nebeneinander auszuführen – die OpenAI-kompatible API bedeutet, dass sich der Code nicht ändert, sondern nur die Basis-URL und die Rechnung.
Neu bei der nutzungsbasierten KI-Preisgestaltung? Beginnen Sie mit dem kostenlose API-Kostenleitfäden. Für die geschlossene Modellseite derselben Entscheidung siehe GPT vs. Claude vs. Gemini: Was der gleiche Arbeitsaufwand tatsächlich kostet.
Die Preise wurden anhand der offiziellen Preisseiten von Groq, Together AI und Fireworks überprüft, zuletzt überprüft am 15.08.2026. Referenzschätzungen – Modellverfügbarkeit, Mengenrabatte und ausgehandelte Unternehmenstarife variieren; Bestätigen Sie vor der Budgetierung die aktuellen Preise.