Cómo funciona esta calculadora
El Calculadora de tiempo de respuesta y latencia de LLM estima el tiempo total que un usuario espera a que responda un modelo, no una cifra en dólares. Combina tres factores: el tiempo hasta la primera ficha (el retraso inicial en milisegundos antes de que aparezca cualquier salida), el velocidad de generación en tokens por segundo, y el número de fichas de salida en la respuesta. El tiempo total de respuesta es aproximadamente el retraso del primer token más los tokens de salida divididos por la velocidad de generación, y el solicitudes por minuto La entrada enmarca esto para una sola transmisión para que pueda ver cómo escala la experiencia de un usuario.
La compensación clave es que La latencia total crece con la duración de la respuesta.: un modelo rápido aún puede parecer lento si genera respuestas largas, y un tiempo bajo para el primer token es más importante para respuestas cortas donde los usuarios notan la pausa inicial. Al sintonizar, decida si capacidad de respuesta percibida (primera ficha rápida) o tiempo de finalización (salida breve y rápida) es más importante para su caso de uso y acorte las indicaciones o limite los tokens de salida para mantener las esperas aceptables.
Preguntas frecuentes
¿Qué determina el tiempo de respuesta del LLM?
Dos cosas: tiempo hasta el primer token (TTFT), la espera antes de que comience la transmisión, generalmente de 0,3 a 2 segundos y más para los modelos de razonamiento, y tokens por segundo, la tasa de generación. Tiempo total = TTFT + (tokens de salida ÷ tokens por segundo). La longitud de entrada afecta principalmente a TTFT, la longitud de salida afecta a la generación.
¿Por qué la transmisión se siente más rápida de lo que indica el número?
Debido a que los usuarios leen los tokens a medida que los transmiten, la latencia percibida se acerca a TTFT en lugar del tiempo total. Las respuestas no transmitidas (JSON estructurado, llamadas a herramientas, trabajos por lotes) se bloquean hasta que la respuesta completa está lista, por lo que se siente el tiempo de respuesta completo. Transmita cualquier cosa que un humano espere.