HomeAI APIs › IA de feux d'artifice

Fireworks AI – tarifs, crédits et comment obtenir une clé

IA de feux d'artifice est une plateforme d'inférence rapide pour modèles à poids ouvert — Llama, DeepSeek, Qwen, Mixtral et autres — servis via un API compatible OpenAI. Vous payez par jeton (en fonction de la taille du modèle) pour le sans serveur, ou par heure GPU pour la capacité dédiée. C'est un incontournable lorsque vous souhaitez des modèles ouverts moins chers que ceux à frontière fermée, avec une faible latence.

Tarification de Fireworks AI (référence, juin 2026)

Classe modèlePrix ​​/ 1 million de jetonsExemples
Petit (≤16B)~0,20$Lama 8B, petit Qwen
Moyen (16-80B)~0,90 $Lama 70B, Qwen 72B
Grand MoE / 100B+~1,20 $ à 3,00 $DeepSeek V3, Lama 405B
GPU dédié (à la demande)par heure GPUdébit réservé, par ex. H100/H200
Mise au point et hébergementpar jeton / par GPUentraînez-vous + servez votre propre variante
⚠️ Chiffres de référence, juin 2026 — Fireworks répertorie les tarifs exacts par modèle qui changent à mesure que des modèles sont ajoutés. Confirmez sur fireworks.ai/tarification. Les tarifs sans serveur diffèrent souvent entre les entrées et les sorties sur certains modèles ; les GPU dédiés sont facturés à l'heure quel que soit le volume de jetons. · Signaler un prix obsolète →

Sans serveur ou dédié : qu'est-ce qui est le moins cher ?

Fireworks vous propose deux modèles de facturation. Sans serveur frais par jeton sans frais d'inactivité : idéal pour le trafic intense ou à faible volume, puisque vous ne payez rien entre les requêtes. GPU dédiés à la demande chargez à l'heure mais vous offre un débit réservé et la latence la plus faible, ce qui devient moins cher que par jeton une fois que votre volume est suffisamment élevé et stable pour occuper le GPU. Le crossover est une question d'utilisation : estimez votre volume de jetons, puis comparez le sans serveur par jeton au débit horaire du GPU avec le calculateur auto-hébergé vs API et le Calculateur de coût du cloud GPU.

Les crédits gratuits

Les nouveaux comptes Fireworks bénéficient généralement d'un petit crédit gratuit à tester, ainsi que des limites de débit réalisables sur les modèles sans serveur, plutôt qu'un niveau gratuit permanent. Après le crédit, vous retirez un solde facturé par jeton. Pour l'expérimentation, c'est suffisant ; pour la production, évaluez votre véritable mélange de jetons avec les calculateurs ci-dessous.

Comment obtenir une clé API Fireworks (étape par étape)

1. Inscrivez-vous à feux d'artifice.ai et ouvrez le tableau de bord.
2. Réclamez n'importe quel crédit gratuit et ajoutez la facturation pour une utilisation en production.
3. Aller à Clés API et créez une clé.
4. Utilisez le point de terminaison compatible OpenAI : modifiez simplement l'URL de base et le nom du modèle.

# replace $FIREWORKS_API_KEY
boucle https://api.fireworks.ai/inference/v1/chat/completions \
-H "Autorisation : Porteur $FIREWORKS_API_KEY" \
-H "Type de contenu : application/json" \
-d '{"model": "accounts/fireworks/models/llama-v3p1-8b-instruct", "messages": [{"role": "user", "content": "Bonjour"}]}'

Feux d'artifice vs alternatives

Ensemble IA (voir le Guide Ensemble) est le concurrent le plus proche – même modèle ouvert, par jeton, avec des prix similaires ; comparez les deux pour votre modèle spécifique. Reproduire (voir Reproduire) est plus fort pour les images/vidéos et les démarrages à froid uniques. Groq gagne en vitesse brute pour les modèles pris en charge. Par rapport aux modèles fermés, exécuter un modèle ouvert sur Fireworks est généralement plusieurs fois moins cher par jeton que OpenAI ou Claude — le commerce choisit et s'approprie le modèle ouvert. Classez tout pour votre mélange de jetons avec le outil API LLM le moins cher.

FAQ

Combien coûte l’IA Fireworks ?

Par jeton par taille de modèle : ~0,20 $/1 M pour les petits modèles, ~0,90 $/1 M pour les modèles moyens, ~1,20 à 3 $/1 M pour les grands modèles du MoE (référence, juin 2026). Les GPU dédiés sont facturés à l’heure.

Fireworks est-il compatible avec OpenAI ?

Oui : utilisez le SDK OpenAI, pointez l'URL de base sur api.fireworks.ai et définissez le modèle sur le chemin du modèle Fireworks.

Quand dois-je utiliser des GPU dédiés plutôt que sans serveur ?

Lorsque votre trafic est suffisamment élevé et stable pour occuper un GPU, le débit réservé dépasse le coût par jeton au-dessus du croisement d'utilisation. Le trafic faible ou ponctuel reste moins cher avec le sans serveur.

Puis-je affiner les réglages sur Fireworks ?

Oui : Fireworks prend en charge le réglage fin des modèles ouverts et la diffusion du résultat, facturé par jeton de formation et par jeton d'inférence. Comparez avec le calculateur de réglage fin avant de vous engager.

Non affilié à Fireworks AI. Les prix sont des estimations de référence – vérifiez toujours sur la page de tarification officielle.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger