Feuerwerks-KI ist eine schnelle Inferenzplattform für Modelle mit offenem Gewicht – Llama, DeepSeek, Qwen, Mixtral und andere – bedient über eine OpenAI-kompatible API. Sie zahlen pro Token (skaliert nach Modellgröße) für serverlose Kapazität oder pro GPU-Stunde für dedizierte Kapazität. Es ist die erste Wahl, wenn Sie offene Modelle mit geringer Latenz günstiger als geschlossene Modelle wünschen.
| Modellklasse | Preis / 1 Mio. Token | Beispiele |
|---|---|---|
| Klein (≤16B) | ~0,20 $ | Lama 8B, kleiner Qwen |
| Mittel (16–80B) | ~0,90 $ | Lama 70B, Qwen 72B |
| Großes MoE / 100 Mrd.+ | ~1,20–3,00 $ | DeepSeek V3, Lama 405B |
| Dedizierte GPU (auf Abruf) | pro GPU-Stunde | reservierter Durchsatz, z.B. H100/H200 |
| Feinabstimmung und Hosting | pro Token / pro GPU | Trainiere + serviere deine eigene Variante |
Fireworks bietet Ihnen zwei Abrechnungsmodelle. Serverlos Gebühren pro Token ohne Leerlaufkosten – ideal für Spitzen- oder geringen Datenverkehr, da Sie zwischen den Anfragen nichts bezahlen. Dedizierte On-Demand-GPUs Laden Sie stundenweise ab, bieten Sie aber einen reservierten Durchsatz und die niedrigste Latenz, die günstiger wird als pro Token, sobald Ihr Volumen hoch und stabil genug ist, um die GPU zu beschäftigen. Der Crossover ist eine Auslastungsfrage: Schätzen Sie Ihr Token-Volumen und vergleichen Sie dann serverlos pro Token die stündliche GPU-Rate mit der Selbstgehosteter vs. API-Rechner und die GPU-Cloud-Kostenrechner.
Neue Fireworks-Konten erhalten normalerweise eine kleines kostenloses Guthaben zum Testen, zusammen mit praktikablen Ratenbegrenzungen für serverlose Modelle anstelle eines dauerhaften kostenlosen Kontingents. Nach der Gutschrift ziehen Sie pro Token einen Rechnungsbetrag ab. Zum Experimentieren reicht es; Bewerten Sie für die Produktion Ihren echten Token-Mix mit den untenstehenden Rechnern.
1. Melden Sie sich an unter fireworks.ai und öffnen Sie das Dashboard.
2. Behaupten Sie irgendetwas kostenloses Guthaben und fügen Sie die Abrechnung für die Produktionsnutzung hinzu.
3. Gehe zu API-Schlüssel und einen Schlüssel erstellen.
4. Verwenden Sie den OpenAI-kompatiblen Endpunkt – ändern Sie einfach die Basis-URL und den Modellnamen.
Gemeinsam KI (siehe die Gemeinsamer Leitfaden) ist der engste Konkurrent – dasselbe offene Modell, Pro-Token-Modell mit ähnlichen Preisen; Vergleichen Sie beides für Ihr spezifisches Modell. Replizieren (sehen Replizieren) ist bei Bild-/Video- und Kaltstart-Einzelstücken stärker. Groq gewinnt bei der Rohgeschwindigkeit für unterstützte Modelle. Im Vergleich zu geschlossenen Modellen ist die Ausführung eines offenen Modells auf Fireworks pro Token in der Regel um ein Vielfaches günstiger als OpenAI oder Claude — Der Handel wählt und besitzt das offene Modell. Ordnen Sie alles für Ihren Token-Mix mit dem günstigstes LLM-API-Tool.
Pro Token nach Modellgröße: ~0,20 $/1 Mio. für kleine Modelle, ~0,90 $/1 Mio. für mittlere, ~1,20–3 $/1 Mio. für große MoE-Modelle (Referenz, Juni 2026). Dedizierte GPUs werden pro Stunde abgerechnet.
Ja – verwenden Sie das OpenAI SDK, verweisen Sie auf die Basis-URL auf api.fireworks.ai und legen Sie das Modell auf den Fireworks-Modellpfad fest.
Wenn Ihr Datenverkehr hoch und stabil genug ist, um eine GPU auszulasten, übertrifft der reservierte Durchsatz die Kosten pro Token über dem Auslastungs-Crossover. Niedriger oder starker Datenverkehr bleibt bei serverlosem Betrieb günstiger.
Ja – Fireworks unterstützt die Feinabstimmung offener Modelle und die Bereitstellung des Ergebnisses, die Abrechnung erfolgt pro Trainings-Token und pro Inferenz-Token. Vergleichen Sie mit dem Feinabstimmungsrechner, bevor Sie sich verpflichten.
Nicht mit Fireworks AI verbunden. Bei den Preisen handelt es sich um Richtwerte – überprüfen Sie diese stets auf der offiziellen Preisseite.