Chaque GPU à vos heures et comptez
Coût mensuel pour les heures et le nombre de GPU ci-dessus – à la demande et ponctuellement côte à côte.
| GPU | VRAM | Sur demande $/h | Spot $/h | Mensuel (votre niveau) |
|---|
Un GPU loué facture toutes les heures où il est allumé
Ce qui surprend les équipes qui passent des API à leurs propres GPU, c'est que le compteur ne s'arrête jamais. Une API par jeton ne coûte rien lorsque le trafic est calme ; un H100 loué coûte le même prix, qu'il soit saturé ou à 2 % d'utilisation, car vous payez pour l'heure, pas pour le travail. C'est pourquoi le principal levier sur votre facture n'est pas le GPU que vous choisissez, mais le nombre de GPU. heures vous le faites fonctionner. Un H100 dont vous n'avez besoin que huit heures par jour coûte le tiers d'un appareil allumé 24 heures sur 24. Cette calculatrice rend cela explicite : définissez les heures réelles, et non le maximum théorique, et observez l'évolution du nombre mensuel. La liste déroulante de configuration rapide couvre les modèles courants : inférence permanente, boîte de formation le jour ouvrable, exécutions par lots le week-end.
Le niveau est le deuxième levier. La capacité à la demande est garantie aussi longtemps que vous la détenez et tarifée à un prix plus élevé ; Les instances spot, communautaires et interruptibles sont des capacités de réserve vendues 20 à 50 % moins cher, avec la possibilité que le fournisseur puisse les reprendre. Pour les formations aux points de contrôle ou les travaux par lots tolérants aux pannes, le spot est proche de l'argent gratuit ; pour un point final d'inférence qui ne peut pas cligner des yeux, la prime à la demande vous offre de la stabilité. Le tableau montre les deux tarifs pour chaque carte, le compromis est donc devant vous. Une fois que vous avez le numéro de location, la vraie question est de savoir si posséder des heures de GPU vaut réellement mieux payer par jeton – résolvez cela avec le calculateur LLM vs API auto-hébergé, puis évaluez la bande passante servie par votre modèle avec le calculateur de sortie du cloud et les points finaux d'inférence eux-mêmes avec le calculateur de coût de fonction sans serveur.
Comment l'utiliser
1. Choisissez votre GPU : ses tarifs typiques à la demande et au comptant se chargent automatiquement.
2. Choisissez à la demande ou ponctuellement et définissez le nombre de GPU que vous utilisez.
3. Définissez les heures par mois ou utilisez la liste déroulante de réglage rapide pour un cycle de service commun.
4. Lisez le coût mensuel et les économies ponctuelles, et comparez chaque GPU du tableau.
Erreurs courantes
En supposant qu'il soit toujours actif. 730 heures est le maximum, pas votre utilisation : la plupart des charges de travail nécessitent beaucoup moins. Oublier les factures d'inactivité. Un GPU laissé en fonctionnement entre les tâches coûte toujours le plein tarif ; arrêtez-le ou utilisez la mise à l'échelle automatique. Choisir la plus grosse carte. Un L4 ou 4090 sert souvent un petit modèle pour une fraction du coût d'un H100 : faites correspondre le GPU au modèle. Ignorer le stockage et la sortie. Les volumes, les instantanés et le transfert de données sont des éléments distincts ; ajoutez du stockage ci-dessus et prix de sortie séparément.
FAQ
De quel GPU ai-je besoin pour mon modèle ?
En gros : les modèles 7 à 13B s'adaptent à un L4, RTX 4090 ou A100 40 Go ; Les modèles de classe 70B nécessitent un A100/H100 80 Go ou plusieurs cartes. Une carte plus grande n'est pas moins chère si une carte plus petite gère la charge : faites correspondre la VRAM au modèle et à la taille du lot.
Combien d'heures est « toujours allumé » ?
Environ 730 — soit 24 × 365 ÷ 12. Toute utilisation inférieure à une utilisation continue devrait définir les heures réelles, car le coût évolue linéairement avec elles.
Pourquoi les prix diffèrent-ils autant entre les fournisseurs ?
Les cloud spécialisés (RunPod, Vast.ai, Lambda) et les marchés communautaires/spots sont considérablement inférieurs aux hyperscalers pour le même silicium. Les tarifs ici sont un mélange de milieu de marché : le prix en direct de votre fournisseur est celui qui compte.
Cela inclut-il le coût de l'API du modèle lui-même ?
Non, il s'agit d'une location de GPU brut. Pour comparer la location et l'auto-hébergement à une API par jeton, utilisez l'outil calculateur auto-hébergé vs API.
Estimation seulement. Les tarifs des GPU évoluent constamment et varient selon le fournisseur et la région : vérifiez les prix en direct avant de vous y fier.