Comment fonctionne cette calculatrice
Le Calculateur de coût d'évaluation LLM estime la dépense symbolique d'une seule exécution d'évaluation, où un ensemble de cas de test est passé par un ou plusieurs modèles et noté par un modèle de juge. Il multiplie le nombre de cas de tests par le modèles comparés, puis par le jetons par caisse — couvrant à la fois les jetons de génération produits par les modèles testés et les jetons de juge dépensés pour noter chaque réponse — et applique votre $ pour 1 million de jetons taux pour convertir ce total en un montant en dollars. Les principaux facteurs déterminants sont donc la taille de votre ensemble de tests, le nombre de modèles que vous évaluez en parallèle et le nombre de jetons consommés par chaque cycle génération plus juge.
Le principal compromis à surveiller est que les coûts augmentent multiplicativement: l'ajout de modèles ou l'extension de l'ensemble de tests n'ajoute pas seulement des jetons, cela les aggrave, et la réussite du juge peut tranquillement doubler l'utilisation par cas. Avant d'effectuer un grand balayage, utilisez la calculatrice pour dimensionner un échantillon représentatif plus petit et confirmer que le coût par exécution est acceptable, car une invite d'évaluation lourde ou une longue suite de tests peut rendre les exécutions d'évaluation répétées beaucoup plus coûteuses que ne le suggère une seule génération. Vérifier d'abord l'estimation vous aide à décider s'il convient de réduire les cas, de réduire les modèles comparés ou d'utiliser un juge moins cher.
Questions fréquemment posées
Combien coûte l’évaluation LLM ?
Le coût correspond aux cas de test multipliés par les modèles multipliés par les jetons par cas, y compris le modèle de juge lisant chaque réponse. Un LLM en tant que juge double à peu près les jetons car chaque réponse générée est également notée. L’exécution de la suite à chaque commit multiplie cela au cours du mois.
Comment puis-je réduire les coûts d’évaluation ?
Utilisez un modèle plus petit et moins cher comme juge, conservez un ensemble d'or ciblé plutôt que des milliers de cas et exécutez la suite complète tous les soirs avec un ensemble de fumée rapide à chaque commit. Vous n'avez pas besoin d'évaluer chaque modèle à chaque poussée.