Preguntas frecuentes
¿Qué determina el tiempo de respuesta del LLM?
Dos cosas: tiempo hasta el primer token (TTFT), la espera antes de que comience la transmisión, generalmente de 0,3 a 2 segundos y más para los modelos de razonamiento, y tokens por segundo, la tasa de generación. Tiempo total = TTFT + (tokens de salida ÷ tokens por segundo). La longitud de entrada afecta principalmente a TTFT, la longitud de salida afecta a la generación.
¿Por qué la transmisión se siente más rápida de lo que indica el número?
Debido a que los usuarios leen los tokens a medida que los transmiten, la latencia percibida se acerca a TTFT en lugar del tiempo total. Las respuestas no transmitidas (JSON estructurado, llamadas a herramientas, trabajos por lotes) se bloquean hasta que la respuesta completa está lista, por lo que se siente el tiempo de respuesta completo. Transmita cualquier cosa que un humano espere.