Paramètres partagés
Variante UN (contrôle)
Variante B (challenger)
| Métrique | Variante A | Variante B |
|---|
Comment budgétiser un test LLM A/B
Le coût d’une expérience sur modèle est souvent négligé. Pour les applications à fort trafic, même un test 50/50 de 7 jours avec un modèle premium peut coûter des centaines de dollars de plus que de rester sous contrôle. Calculer le delta avant commencez le test, puis décidez si le signal de qualité vaut la dépense supplémentaire.
Règle pratique : Vous avez besoin d'au moins 200 à 500 échantillons par variante pour obtenir un signal de qualité significatif (puissance de 80 %, p = 0,05, détectant une différence de 5 à 10 %). Pour une application de 10 000 requêtes/jour, même une répartition du trafic de 10 % fournit plus de 500 échantillons par jour — un test de 3 jours suffit. N'exécutez plus longtemps que si vous recherchez des échecs rares dans les cas extrêmes.
Test de l'ombre en premier : Avant le direct A/B, exécutez la variante B en mode fantôme (même entrée, sorties supprimées). Cela coûte de l'argent mais n'a aucun impact sur l'utilisateur et vous permet de détecter les pannes catastrophiques avant qu'elles n'affectent les utilisateurs réels.
En rapport: Calculateur de coût d'évaluation LLM · Suivi des dépenses de l'IA · Planificateur de budget API
Questions fréquemment posées
Combien coûte le test A/B de deux modèles LLM ?
Coût = (requests × traffic_split × tokens_per_request × price_per_token) pour chaque variante. Une répartition 50/50 avec 10 000 requêtes quotidiennes, 1 000 jetons chacune et des modèles à 3 $/15 $ contre 0,15 $/0,60 $ par million de jetons coûterait environ 90 $/jour contre environ 3,75 $/jour pour un test de 7 jours.
Quelle est la taille minimale de l’échantillon pour un test LLM A/B statistiquement valide ?
Pour la plupart des mesures de qualité LLM, vous avez besoin d'au moins 200 à 500 échantillons par variante pour détecter une différence de 5 à 10 % avec une puissance de 80 % à p = 0,05. Pour des différences plus étroites (2 à 3 %), vous aurez peut-être besoin de 1 000 à 2 000 échantillons par variante.
Comment choisir une répartition du trafic pour les tests LLM A/B ?
Commencez par 10/90 ou 20/80 si le nouveau modèle n’a pas été testé. Passez au 50/50 une fois que vous êtes sûr que le nouveau modèle n’est pas pire. Ne vous mettez jamais à 100 % sur le nouveau modèle sans un test d'ombre au préalable.
Dois-je d'abord tester les invites ou les modèles ?
Testez d’abord les invites : elles sont libres de changer et peuvent affecter considérablement la qualité. Une fois que vous disposez d’une meilleure invite stable pour chaque modèle, comparez les modèles.
Quelles métriques dois-je suivre dans un test LLM A/B ?
Suivi : taux de réussite des tâches, latence (p50/p95), durée de sortie, coût par sortie réussie et échantillon d'évaluation humaine. Évitez d'utiliser un LLM pour en juger un autre dans la même famille - utilisez un modèle de juge différent ou des évaluateurs humains.