Comment fonctionne cette calculatrice
Le Calculateur de latence et de temps de réponse LLM estime le temps total pendant lequel un utilisateur attend la réponse d'un modèle, et non un chiffre en dollars. Il combine trois moteurs : le temps jusqu'au premier jeton (le délai initial en millisecondes avant qu'une sortie n'apparaisse), le vitesse de génération en jetons par seconde, et le nombre de jetons de sortie dans la réponse. Le temps de réponse total correspond approximativement au délai du premier jeton plus les jetons de sortie divisé par la vitesse de génération, et le requêtes par minute l'entrée encadre ceci pour un seul flux afin que vous puissiez voir comment l'expérience d'un utilisateur évolue.
Le compromis clé est que la latence totale augmente avec la longueur de la réponse: un modèle rapide peut toujours sembler lent s'il génère de longues réponses, et un faible temps d'attente pour le premier jeton est particulièrement important pour les réponses courtes où les utilisateurs remarquent la pause initiale. Lors du réglage, décidez si réactivité perçue (premier jeton rapide) ou temps d'achèvement (sortie courte et rapide) est plus important pour votre cas d'utilisation, et raccourcissez les invites ou limitez les jetons de sortie pour maintenir les attentes acceptables.
Questions fréquemment posées
Qu'est-ce qui détermine le temps de réponse du LLM ?
Deux choses : le délai d'obtention du premier jeton (TTFT) – l'attente avant le début du streaming, généralement de 0,3 à 2 s et plus pour les modèles de raisonnement – et les jetons par seconde, le taux de génération. Temps total = TTFT + (jetons de sortie ÷ jetons par seconde). La longueur d'entrée affecte principalement TTFT, la longueur de sortie affecte la génération.
Pourquoi le streaming semble-t-il plus rapide que ce que dit le chiffre ?
Étant donné que les utilisateurs lisent les jetons au fur et à mesure de leur diffusion, la latence perçue est proche du TTFT plutôt que du temps total. Les réponses non diffusées (JSON structuré, appels d'outils, tâches par lots) se bloquent jusqu'à ce que la réponse complète soit prête, de sorte que le temps de réponse complet se fait sentir. Diffusez tout ce qu'un humain attend.