Questions fréquemment posées
Qu'est-ce qui détermine le temps de réponse du LLM ?
Deux choses : le délai d'obtention du premier jeton (TTFT) – l'attente avant le début du streaming, généralement de 0,3 à 2 s et plus pour les modèles de raisonnement – et les jetons par seconde, le taux de génération. Temps total = TTFT + (jetons de sortie ÷ jetons par seconde). La longueur d'entrée affecte principalement TTFT, la longueur de sortie affecte la génération.
Pourquoi le streaming semble-t-il plus rapide que ce que dit le chiffre ?
Étant donné que les utilisateurs lisent les jetons au fur et à mesure de leur diffusion, la latence perçue est proche du TTFT plutôt que du temps total. Les réponses non diffusées (JSON structuré, appels d'outils, tâches par lots) se bloquent jusqu'à ce que la réponse complète soit prête, de sorte que le temps de réponse complet se fait sentir. Diffusez tout ce qu'un humain attend.