Comment fonctionne cette calculatrice
Le Calculateur de coût d'auto-hébergement et d'API calcule deux chiffres mensuels côte à côte : ce que vous paieriez à un fournisseur au tarif API par jeton et ce qu'il en coûterait pour louer un GPU et exécuter vous-même un modèle ouvert. Le côté API est simple : votre jetons par mois multiplié par le Prix de l'API par million de jetons. Le côté auto-hôte est piloté par le Tarif horaire GPU, le modèle débit en jetons par seconde, et votre utilisation réaliste, qui fixent ensemble un coût effectif par jeton. L'outil trouve ensuite le volume mensuel pour lequel l'auto-hébergement devient moins cher que le paiement par token.
Le chiffre à surveiller de plus près est utilisation. Un GPU loué facture toutes les heures, qu'il soit occupé ou inactif, donc une carte fonctionnant à 20 % de sa capacité coûte effectivement cinq fois plus par jeton qu'une carte maintenue saturée. L'auto-hébergement a tendance à gagner seulement à volume élevé et constant; en dessous du seuil de rentabilité, les prix des API sont généralement moins chers et ne comportent aucun engagement fixe. Avant de changer, confirmez que votre trafic réel peut réellement occuper le matériel. estimation optimiste du débit ou de l'utilisation peut rendre l’auto-hébergement bien meilleur qu’il ne le fait dans la pratique.
Questions fréquemment posées
Quand l’auto-hébergement d’un LLM est-il moins cher qu’une API ?
Uniquement à volume élevé et constant. Un GPU loué représente un coût fixe 24h/24 et 7j/7, il est donc rentable une fois que le débit de vos jetons le remplit. En dessous du seuil de rentabilité, l'API par jeton est moins chère car vous ne payez que pour ce que vous utilisez ; au-dessus, un GPU bien utilisé bat le prix mesuré.
Quels coûts cachés l’auto-hébergement ajoute-t-il ?
L'utilisation est le problème le plus important : un GPU facturé 24 heures sur 24 mais utilisé 30 % du temps triple votre coût effectif par jeton. À cela s’ajoutent le temps d’ingénierie, la mise à l’échelle automatique des pics, les écarts de qualité des modèles par rapport aux API frontières et la fiabilité. Tenez compte de ceux-ci avant de passer à la sauvegarde des autocollants.