—
économies grâce à la location de GPU par rapport à l'API gérée—coût du fournisseur géré
—Coût de location du GPU
—Heures GPU nécessaires
Tarifs des fournisseurs gérés par rapport à la location de GPU, selon la taille de votre ensemble de données
Même nombre de jetons de formation que ci-dessus (ensemble de données × jetons moyens × époques), tarifé en fonction du tarif LoRA publié par chaque fournisseur géré, à côté de vos paramètres de location de GPU.
| Option | Taux | Coût de la formation |
|---|
Coût par taille d'ensemble de données
Tout le reste est maintenu aux valeurs ci-dessus, balayé sur la taille de l'ensemble de données (exemples de formation), en comparant le débit géré sélectionné aux paramètres de location de votre GPU. La ligne en surbrillance est la plus proche de la taille actuelle de votre ensemble de données.
| Exemples | Jetons d'entraînement | Coût maîtrisé | Coût du GPU | Option moins chère |
|---|
Comment cela se connecte à d'autres outils
Ce calculateur évalue une décision spécifique : payer le tarif par jeton d'un fournisseur géré pour la formation LoRA/QLoRA, ou louer un GPU vous-même et exécuter le travail directement. Si votre travail est un complet affiner - mettre à jour chaque paramètre, pas un petit ensemble d'adaptateurs de bas rang - c'est une forme de coût entièrement différente, évaluée par rapport aux tarifs des jetons de formation d'OpenAI, de Google et de Mistral sur le marché. calculateur de coûts de réglage fin; pour connaître tous les coûts de réglage précis pour ces fournisseurs, consultez cet outil au lieu de celui-ci. Si vous envisagez un réglage fin plutôt qu'une simple invitation à un modèle de base, le inviter ou affiner la calculatrice et RAG vs réglage fin les pages couvrent cette décision antérieure. Et une fois qu'un modèle optimisé par LoRA est formé, le servir à long terme est sa propre question de construction ou d'achat - le calculateur LLM vs API auto-hébergé évalue cette décision d'inférence en cours de la même manière que cette page évalue la décision de formation unique.
Comment fonctionne cette calculatrice
Le Réglage fin LoRA / QLoRA : API gérée vs calculateur de location GPU commence à partir de la charge totale de travail de formation : taille de l'ensemble de données (exemples de formation) × jetons moyens par exemple × époques donne le total jetons de formation le travail doit être traité – par défaut, 50 000 × 512 × 2 correspond à 51 200 000 jetons de formation. Du côté géré, ce nombre de jetons divisé par 1 000 000 et multiplié par le fournisseur sélectionné. taux par million de jetons de formation donne le coût du fournisseur géré – 24,58 $ par défaut de Together AI. Du côté de la location de GPU, le même nombre de jetons d'entraînement divisé par (débit de formation en jetons/sec × 3 600) donne le Heures GPU nécessaire, qui a été multiplié par le Taux GPU par heure donne le coût brut de calcul ; ajout heures d'installation × votre taux horaire (facultatif, 0 $ par défaut) donne le plein Coût de location du GPU - environ 1,79 $ avec la valeur par défaut de l'A100 avec un coût d'installation de 0 $.
En soustrayant le coût du GPU du coût géré, on obtient le économies de louer vous-même un GPU et de diviser ce montant par le coût géré donne le écart de coût pourcentage – environ 92,7 % moins cher via la location de GPU aux valeurs par défaut. Cela peut devenir négatif : si votre estimation de débit est trop faible, le débit de votre GPU trop élevé ou si vous définissez un taux horaire différent de zéro pour suffisamment d'heures de configuration, l'API gérée peut s'avérer moins chère, et ce calculateur le montre honnêtement plutôt que de supposer que le bricolage gagne toujours. Le débit de formation Le champ est l'entrée la plus sensible - il varie énormément en fonction du nombre de paramètres du modèle, donc la valeur par défaut de 15 000 jetons/s n'est qu'une estimation de départ ; remplacez-le par un nombre comparé à la taille réelle de votre modèle et à votre GPU avant de vous fier au résultat financier pour une véritable décision budgétaire.
Questions fréquemment posées
Le réglage fin de LoRA est-il moins cher via l'API ou la location d'un GPU ?
Avec des tailles d'ensemble de données typiques, louer un GPU vous-même et exécuter directement la tâche de formation LoRA/QLoRA est généralement beaucoup moins cher en termes de dollars bruts que de payer le tarif de formation par jeton d'un fournisseur géré. Aux valeurs par défaut de cette calculatrice (50 000 exemples, 512 jetons/exemple, 2 époques), une tâche LoRA gérée sur Together AI (0,48 $ par million de jetons de formation) coûte environ 24,58 $, tandis que les mêmes 51,2 millions de jetons de formation sur un A100 80 Go loué à 1,89 $/h et un débit de 15 000 jetons/s coûtent environ 1,79 $ – plus de 90 % de moins. Mais cet écart est une comparaison brute des coûts de calcul, et non une comparaison du coût total de possession : il n'inclut pas le temps passé à configurer le pipeline de formation, à gérer les points de contrôle ou aux échecs de débogage, ce qu'une API gérée ne vous oblige pas à faire. Le fait que la location de GPU soit réellement moins chère pour vous dépend de la valeur que vous accordez à ce temps de configuration, c'est pourquoi cette calculatrice dispose d'un champ facultatif d'heures de configuration que vous pouvez augmenter au-dessus de zéro pour voir l'image changer.
De quel GPU ai-je besoin pour le réglage fin de LoRA ?
Pour la plupart des tâches LoRA/QLoRA sur des modèles allant jusqu'à environ 13B-34B de paramètres, un seul GPU de 80 Go (un A100 de 80 Go ou un H100 de 80 Go) suffit, car LoRA n'entraîne qu'un petit ensemble de poids d'adaptateur de bas rang plutôt que le modèle complet, et QLoRA quantifie les poids de base gelés à 4 bits pour réduire davantage la mémoire, de sorte que l'ensemble du travail tient sur une seule carte au lieu du cluster multi-GPU. un réglage fin serait nécessaire. Des modèles de base plus grands ou des fenêtres contextuelles plus longues augmentent les besoins en mémoire et peuvent nécessiter une taille de lot plus petite, une quantification plus agressive ou un GPU plus grand, et le débit d'entraînement réel (jetons/seconde) varie considérablement en fonction du nombre de paramètres. Cette calculatrice est par défaut de 15 000 jetons/s à titre d'estimation illustrative, mais vous devez l'ajuster à un nombre évalué en fonction de la taille de votre modèle et de votre GPU avant de vous fier au résultat en dollars.
Pourquoi y a-t-il un si grand écart de coûts entre le géré et le bricolage ?
Les API de formation LoRA gérées comme Together AI et Fireworks ne facturent pas seulement les secondes GPU brutes : le tarif par jeton regroupe la fiabilité de l'infrastructure, l'orchestration des tâches, les points de contrôle automatiques, la mise en file d'attente et les tentatives, ainsi qu'une équipe d'assistance à laquelle vous pouvez faire appel si une exécution de formation échoue en cours de route, dont aucune ne vous permet de louer vous-même une instance de GPU nue. Ce forfait comporte une réelle majoration sur le coût de calcul sous-jacent, et comme un A100 ou un H100 loué facturé à l'heure n'a pas de majoration de ce type au-delà de la propre marge du fournisseur de cloud, l'écart entre les deux peut paraître énorme lorsque vous comparez uniquement la ligne de coût de calcul. La mise en garde honnête est que le bricolage n'est pas gratuit comme le laisse penser la comparaison - quelqu'un doit écrire et déboguer le script de formation, gérer les points de contrôle et gérer les échecs sans ligne d'assistance à appeler, ce qui est en temps réel même s'il n'apparaît jamais comme des frais par jeton.
Quelle est la différence entre LoRA et le coût total de mise au point ?
Le réglage fin complet met à jour chaque paramètre du modèle, c'est pourquoi notre calculateur de réglage fin complet modélise le coût de formation en tant que jetons d'ensemble de données multiplié par les époques multiplié par le taux de formation du fournisseur au-dessus d'un modèle de base que vous modifiez entièrement - et il a généralement besoin de suffisamment de mémoire GPU (ou de budget de formation géré) pour conserver les gradients et l'état de l'optimiseur pour l'ensemble du nombre de paramètres, ce qui est coûteux quelle que soit la taille réelle du modèle. LoRA et QLoRA gèlent plutôt le modèle de base et entraînent un petit nombre de poids d'adaptateur de bas rang ajoutés, de sorte que l'empreinte de calcul et de mémoire - et donc le coût, à la fois du côté de l'API gérée et de la location de GPU - ne représente qu'une petite fraction d'un réglage fin complet pour un ensemble de données comparable. C'est pourquoi ce calculateur et le calculateur de réglage fin complet utilisent des formes de coûts différentes : le réglage fin complet est principalement tarifé en fonction des tarifs de formation du fournisseur, car le réglage fin complet DIY est rarement pratique sur un seul GPU loué, tandis que LoRA/QLoRA est bon marché et suffisamment petit pour que la location d'un seul GPU vous-même devienne une alternative réaliste, souvent beaucoup moins chère, à une API gérée.