Comment fonctionne cette calculatrice
Le Calculateur de coût d'inférence GPU convertit trois entrées - votre Prix du GPU par heure, modèle débit en jetons par seconde, et un pourcentage d'utilisation réaliste - dans le vrai coût par million de jetons pour un modèle auto-hébergé. L'idée de base est simple : une heure de temps GPU permet d'acheter un nombre fixe de jetons, donc en divisant le coût horaire par les jetons réellement produits, on obtient le prix par jeton. Le débit définit le nombre de jetons générés par le matériel chaque seconde, tandis que les réductions d'utilisation reflètent le temps d'inactivité, les écarts de traitement par lots et le trafic qui maintient rarement le GPU à pleine charge.
Le compromis clé est utilisation. Le débit de référence suppose un GPU constamment occupé, mais les charges de travail réelles restent inactives entre les requêtes, de sorte qu'un GPU loué facturé à l'heure peut coûter beaucoup plus cher par jeton que ce que le chiffre suggéré par le titre. Avant de vous engager dans l'auto-hébergement, estimez votre vrai utilisez-la honnêtement et comparez le résultat à la tarification de l'API par jeton : un trafic faible et irrégulier favorise souvent une API, tandis que des récompenses constantes et élevées en matière de possession du matériel.
Questions fréquemment posées
Comment calculer le coût par jeton sur mon propre GPU ?
Prenez le prix horaire du GPU et divisez-le par le nombre de jetons qu'il sert réellement par heure. Cela correspond au débit (jetons/s) multiplié par 3 600, adapté à votre utilisation réelle. Un GPU facturé en continu mais à moitié inactif sert la moitié des jetons, de sorte que son coût par jeton double par rapport au débit de la feuille de données.
Pourquoi mon coût d’auto-hébergement est-il plus élevé que prévu ?
Presque toujours utilisation et mise en lots. Le débit de référence suppose une charge complète et par lots ; le trafic réel est intense, de sorte que le GPU reste inactif entre les requêtes pendant que le compteur fonctionne. Le traitement par lots continu, le dimensionnement correct du GPU et la consolidation du trafic sur des GPU moins nombreux et plus occupés sont les principaux moyens de réduire le coût par jeton.