IA de feux d'artifice est une plateforme d'inférence rapide pour modèles à poids ouvert — Llama, DeepSeek, Qwen, Mixtral et autres — servis via un API compatible OpenAI. Vous payez par jeton (en fonction de la taille du modèle) pour le sans serveur, ou par heure GPU pour la capacité dédiée. C'est un incontournable lorsque vous souhaitez des modèles ouverts moins chers que ceux à frontière fermée, avec une faible latence.
| Classe modèle | Prix / 1 million de jetons | Exemples |
|---|---|---|
| Petit (≤16B) | ~0,20$ | Lama 8B, petit Qwen |
| Moyen (16-80B) | ~0,90 $ | Lama 70B, Qwen 72B |
| Grand MoE / 100B+ | ~1,20 $ à 3,00 $ | DeepSeek V3, Lama 405B |
| GPU dédié (à la demande) | par heure GPU | débit réservé, par ex. H100/H200 |
| Mise au point et hébergement | par jeton / par GPU | entraînez-vous + servez votre propre variante |
Fireworks vous propose deux modèles de facturation. Sans serveur frais par jeton sans frais d'inactivité : idéal pour le trafic intense ou à faible volume, puisque vous ne payez rien entre les requêtes. GPU dédiés à la demande chargez à l'heure mais vous offre un débit réservé et la latence la plus faible, ce qui devient moins cher que par jeton une fois que votre volume est suffisamment élevé et stable pour occuper le GPU. Le crossover est une question d'utilisation : estimez votre volume de jetons, puis comparez le sans serveur par jeton au débit horaire du GPU avec le calculateur auto-hébergé vs API et le Calculateur de coût du cloud GPU.
Les nouveaux comptes Fireworks bénéficient généralement d'un petit crédit gratuit à tester, ainsi que des limites de débit réalisables sur les modèles sans serveur, plutôt qu'un niveau gratuit permanent. Après le crédit, vous retirez un solde facturé par jeton. Pour l'expérimentation, c'est suffisant ; pour la production, évaluez votre véritable mélange de jetons avec les calculateurs ci-dessous.
1. Inscrivez-vous à feux d'artifice.ai et ouvrez le tableau de bord.
2. Réclamez n'importe quel crédit gratuit et ajoutez la facturation pour une utilisation en production.
3. Aller à Clés API et créez une clé.
4. Utilisez le point de terminaison compatible OpenAI : modifiez simplement l'URL de base et le nom du modèle.
Ensemble IA (voir le Guide Ensemble) est le concurrent le plus proche – même modèle ouvert, par jeton, avec des prix similaires ; comparez les deux pour votre modèle spécifique. Reproduire (voir Reproduire) est plus fort pour les images/vidéos et les démarrages à froid uniques. Groq gagne en vitesse brute pour les modèles pris en charge. Par rapport aux modèles fermés, exécuter un modèle ouvert sur Fireworks est généralement plusieurs fois moins cher par jeton que OpenAI ou Claude — le commerce choisit et s'approprie le modèle ouvert. Classez tout pour votre mélange de jetons avec le outil API LLM le moins cher.
Par jeton par taille de modèle : ~0,20 $/1 M pour les petits modèles, ~0,90 $/1 M pour les modèles moyens, ~1,20 à 3 $/1 M pour les grands modèles du MoE (référence, juin 2026). Les GPU dédiés sont facturés à l’heure.
Oui : utilisez le SDK OpenAI, pointez l'URL de base sur api.fireworks.ai et définissez le modèle sur le chemin du modèle Fireworks.
Lorsque votre trafic est suffisamment élevé et stable pour occuper un GPU, le débit réservé dépasse le coût par jeton au-dessus du croisement d'utilisation. Le trafic faible ou ponctuel reste moins cher avec le sans serveur.
Oui : Fireworks prend en charge le réglage fin des modèles ouverts et la diffusion du résultat, facturé par jeton de formation et par jeton d'inférence. Comparez avec le calculateur de réglage fin avant de vous engager.
Non affilié à Fireworks AI. Les prix sont des estimations de référence – vérifiez toujours sur la page de tarification officielle.