HomeAI APIs › Feuerwerks-KI

Fireworks AI – Preise, Credits und wie man einen Schlüssel bekommt

Feuerwerks-KI ist eine schnelle Inferenzplattform für Modelle mit offenem Gewicht – Llama, DeepSeek, Qwen, Mixtral und andere – bedient über eine OpenAI-kompatible API. Sie zahlen pro Token (skaliert nach Modellgröße) für serverlose Kapazität oder pro GPU-Stunde für dedizierte Kapazität. Es ist die erste Wahl, wenn Sie offene Modelle mit geringer Latenz günstiger als geschlossene Modelle wünschen.

Preise für Fireworks AI (Referenz, Juni 2026)

ModellklassePreis / 1 Mio. TokenBeispiele
Klein (≤16B)~0,20 $Lama 8B, kleiner Qwen
Mittel (16–80B)~0,90 $Lama 70B, Qwen 72B
Großes MoE / 100 Mrd.+~1,20–3,00 $DeepSeek V3, Lama 405B
Dedizierte GPU (auf Abruf)pro GPU-Stundereservierter Durchsatz, z.B. H100/H200
Feinabstimmung und Hostingpro Token / pro GPUTrainiere + serviere deine eigene Variante
⚠️ Referenzzahlen, Juni 2026 – Fireworks listet die genauen Preise pro Modell auf, die sich ändern, wenn Modelle hinzugefügt werden. Bestätigen Sie am fireworks.ai/pricing. Bei einigen Modellen unterscheiden sich die serverlosen Tarife häufig für Eingabe und Ausgabe. Dedizierte GPUs werden unabhängig vom Token-Volumen stundenweise abgerechnet. · Veralteten Preis melden →

Serverlos oder dediziert – was ist günstiger?

Fireworks bietet Ihnen zwei Abrechnungsmodelle. Serverlos Gebühren pro Token ohne Leerlaufkosten – ideal für Spitzen- oder geringen Datenverkehr, da Sie zwischen den Anfragen nichts bezahlen. Dedizierte On-Demand-GPUs Laden Sie stundenweise ab, bieten Sie aber einen reservierten Durchsatz und die niedrigste Latenz, die günstiger wird als pro Token, sobald Ihr Volumen hoch und stabil genug ist, um die GPU zu beschäftigen. Der Crossover ist eine Auslastungsfrage: Schätzen Sie Ihr Token-Volumen und vergleichen Sie dann serverlos pro Token die stündliche GPU-Rate mit der Selbstgehosteter vs. API-Rechner und die GPU-Cloud-Kostenrechner.

Die kostenlosen Credits

Neue Fireworks-Konten erhalten normalerweise eine kleines kostenloses Guthaben zum Testen, zusammen mit praktikablen Ratenbegrenzungen für serverlose Modelle anstelle eines dauerhaften kostenlosen Kontingents. Nach der Gutschrift ziehen Sie pro Token einen Rechnungsbetrag ab. Zum Experimentieren reicht es; Bewerten Sie für die Produktion Ihren echten Token-Mix mit den untenstehenden Rechnern.

So erhalten Sie einen Fireworks-API-Schlüssel (Schritt für Schritt)

1. Melden Sie sich an unter fireworks.ai und öffnen Sie das Dashboard.
2. Behaupten Sie irgendetwas kostenloses Guthaben und fügen Sie die Abrechnung für die Produktionsnutzung hinzu.
3. Gehe zu API-Schlüssel und einen Schlüssel erstellen.
4. Verwenden Sie den OpenAI-kompatiblen Endpunkt – ändern Sie einfach die Basis-URL und den Modellnamen.

# replace $FIREWORKS_API_KEY
Curl https://api.fireworks.ai/inference/v1/chat/completions \
-H „Autorisierung: Inhaber $FIREWORKS_API_KEY“ \
-H „Inhaltstyp: application/json“ \
-d '{"model": "accounts/fireworks/models/llama-v3p1-8b-instruct", "messages":[{"role": "user", "content": "Hallo"}]}'

Feuerwerk vs. Alternativen

Gemeinsam KI (siehe die Gemeinsamer Leitfaden) ist der engste Konkurrent – ​​dasselbe offene Modell, Pro-Token-Modell mit ähnlichen Preisen; Vergleichen Sie beides für Ihr spezifisches Modell. Replizieren (sehen Replizieren) ist bei Bild-/Video- und Kaltstart-Einzelstücken stärker. Groq gewinnt bei der Rohgeschwindigkeit für unterstützte Modelle. Im Vergleich zu geschlossenen Modellen ist die Ausführung eines offenen Modells auf Fireworks pro Token in der Regel um ein Vielfaches günstiger als OpenAI oder Claude — Der Handel wählt und besitzt das offene Modell. Ordnen Sie alles für Ihren Token-Mix mit dem günstigstes LLM-API-Tool.

FAQ

Wie viel kostet Fireworks AI?

Pro Token nach Modellgröße: ~0,20 $/1 Mio. für kleine Modelle, ~0,90 $/1 Mio. für mittlere, ~1,20–3 $/1 Mio. für große MoE-Modelle (Referenz, Juni 2026). Dedizierte GPUs werden pro Stunde abgerechnet.

Ist Fireworks OpenAI-kompatibel?

Ja – verwenden Sie das OpenAI SDK, verweisen Sie auf die Basis-URL auf api.fireworks.ai und legen Sie das Modell auf den Fireworks-Modellpfad fest.

Wann sollte ich dedizierte GPUs statt serverloser GPUs verwenden?

Wenn Ihr Datenverkehr hoch und stabil genug ist, um eine GPU auszulasten, übertrifft der reservierte Durchsatz die Kosten pro Token über dem Auslastungs-Crossover. Niedriger oder starker Datenverkehr bleibt bei serverlosem Betrieb günstiger.

Kann ich Feuerwerk optimieren?

Ja – Fireworks unterstützt die Feinabstimmung offener Modelle und die Bereitstellung des Ergebnisses, die Abrechnung erfolgt pro Trainings-Token und pro Inferenz-Token. Vergleichen Sie mit dem Feinabstimmungsrechner, bevor Sie sich verpflichten.

Nicht mit Fireworks AI verbunden. Bei den Preisen handelt es sich um Richtwerte – überprüfen Sie diese stets auf der offiziellen Preisseite.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS