7 septembre 2026 · IA & LLM · 5 min de lecture
J'évaluais un fournisseur d'inférence rapide pour une charge de travail d'agent exécutant un modèle ouvert de classe 70B, et les trois noms qui reviennent sans cesse – Groq, Together AI, Fireworks – citent tous des prix par jeton qui semblent similaires en un coup d'œil. Ce n'est pas le cas. Sur les modèles de classe Llama-70B, Groq s'efforce de 0,59 $ d'entrée / 0,79 $ de sortie par million de jetons, Ensemble, l'IA est un appartement $0.88 / $0.88, et Fireworks facture un montant mixte ~ 0,90 $ par million pour son niveau 16-80B. Avec une répartition entrée/sortie réaliste de 70/30, c'est un Écart de 250 $ par mois entre Groq et Fireworks une fois que vous poussez un milliard de jetons – et le moins cher n’est pas automatiquement le bon choix.
Tous les trois exécutent des modèles ouverts – Llama, Qwen, Mixtral, DeepSeek – derrière des API compatibles OpenAI, donc changer de fournisseur est généralement un changement d’URL de base. Voici ce que coûte réellement l’inférence de classe Llama-70B sur chacun, tiré de leurs propres pages de tarification :
| Fournisseur | Modèle | Entrée $/1M | Production $/1M |
|---|---|---|---|
| Groq | Lama 3.3 70B | $0.59 | $0.79 |
| Ensemble IA | Lama 3.1 70B | $0.88 | $0.88 |
| Feux d'artifice | Niveau intermédiaire (16-80B, par exemple Llama 70B) | ~0,90$ mélangé | |
Groq est le moins cher sur papier pour une charge de travail typique sous forme de chat – plus de jetons d'entrée que de sortie – car son prix d'entrée est 33 % inférieur au tarif forfaitaire de Together. Ensemble, l'IA tarife les entrées et les sorties de manière identique, ce qui est plus simple à prévoir mais coûte plus cher en raison des invites à forte entrée que la plupart des charges de travail RAG et agents envoient réellement. Fireworks ne divise pas du tout les entrées/sorties ; son ~ 0,90 $ est un taux mixte unique pour l'ensemble de la classe de modèles 16 à 80B, ce qui facilite l'estimation mais signifie que vous ne pouvez pas optimiser en réduisant la longueur de sortie comme vous le pouvez sur Groq ou Together.
Le prix inférieur de Groq vient du même endroit que sa vitesse : un matériel LPU (Language Processing Unit) personnalisé conçu spécifiquement pour la génération de jetons, au lieu de GPU à usage général. C'est également le véritable argument de vente de Groq par rapport aux deux autres : des centaines de jetons par seconde, bien au-delà de ce que fournit généralement le service basé sur H100. Pour un agent vocal ou une interface utilisateur de chat dans laquelle l'utilisateur surveille le curseur, cette différence de latence compte plus que l'écart de 0,29 $/1 million sur les jetons d'entrée. Le problème : le catalogue de modèles hébergés de Groq est plus restreint que celui de Together ou de Fireworks, et il n'offre pas de capacité dédiée ni de réglage précis. Si le modèle dont vous avez besoin ne figure pas sur la liste de Groq, le prix cesse d'être le facteur décisif.
Together AI propose le catalogue de modèles ouverts le plus large des trois (Llama, Mixtral, Qwen, DeepSeek et plus), ainsi que des points de terminaison dédiés et des réglages fins, donc si le travail consiste à « exécuter ma propre variante affinée » plutôt que « d'appeler un modèle de stock », les prix et les outils plats et faciles à prévoir de Together l'emportent sur la gamme plus étroite et rapide de Groq. Fireworks se situe dans une situation similaire : tarification par jeton sans serveur pour des démarrages rapides, mais également déploiement dédié par heure GPU pour les équipes qui souhaitent un débit réservé et une latence prévisible à grande échelle, ce que ni le catalogue fixe de Groq ni la configuration sans serveur de Together ne couvrent de la même manière. Les deux constituent la meilleure valeur par défaut une fois que la charge de travail a besoin de plus que les « jetons les moins chers pour un modèle pris en charge ».
En supposant une répartition réaliste de 70 % des entrées / 30 % des sorties, typique des invites de chat et de style RAG :
| Jetons / mois | Groq | Ensemble IA | Feux d'artifice |
|---|---|---|---|
| 10 millions (petite application) | $6.50 | $8.80 | $9.00 |
| 100 millions (produit stable) | $65 | $88 | $90 |
| 1 milliard (agent à haut débit) | $650 | $880 | $900 |
L'écart augmente linéairement avec le volume puisque tous les trois sont des prix par jeton pur, sans planchers ni niveaux de plan sur le modèle lui-même - à 1 milliard de jetons par mois, les 650 $ de Groq par rapport aux 900 $ de Fireworks représentent une différence réelle de 250 $, pas une erreur d'arrondi. Mais aucun de ces chiffres ne tient compte de ce qui se passe lorsque le modèle souhaité n'est pas chez le fournisseur le moins cher, ou lorsque la vitesse de Groq réduit votre coût effectif ailleurs : moins de tentatives, des sessions utilisateur plus courtes, moins besoin de mettre en cache de manière agressive juste pour masquer la latence.
Produit sensible à la latence (voix, chat en direct, tout ce qu'un utilisateur regarde pendant la diffusion) : commencez par Groq si votre modèle figure sur sa liste — la vitesse est la décision réelle du produit, et elle s'avère également moins chère. Vous avez besoin d'un modèle ouvert affiné ou moins courant, ou vous souhaitez une capacité dédiée avec un débit prévisible : Together AI ou Fireworks, et choisissez selon que vous appréciez davantage le catalogue plus large de Together ou l'option dédiée à l'heure GPU de Fireworks. Exécuter les trois côte à côte n’est pas non plus déraisonnable : l’API compatible OpenAI signifie que le code ne change pas, seulement l’URL de base et la facture.
Vous débutez dans la tarification de l'IA basée sur l'utilisation ? Commencez par le guides gratuits sur les coûts des API. Pour le côté modèle fermé de la même décision, voir GPT vs Claude vs Gemini : combien coûte réellement la même charge de travail.
Tarifs vérifiés par rapport aux pages de tarification officielles de Groq, Together AI et Fireworks, dernière vérification le 2026-08-15. Estimations de référence — la disponibilité des modèles, les remises sur volume et les tarifs d'entreprise négociés varient ; confirmer les prix actuels avant de budgétiser.