Perguntas frequentes
O que determina o tempo de resposta do LLM?
Duas coisas: tempo até o primeiro token (TTFT) – a espera antes do início do streaming, normalmente 0,3–2s ou mais para modelos de raciocínio – e tokens por segundo, a taxa de geração. Tempo total = TTFT + (tokens de saída ÷ tokens por segundo). O comprimento de entrada afeta principalmente o TTFT, o comprimento de saída afeta a geração.
Por que o streaming parece mais rápido do que o número indica?
Como os usuários leem os tokens à medida que fazem streaming, a latência percebida é próxima do TTFT, e não do tempo total. As respostas não transmitidas (JSON estruturado, chamadas de ferramentas, trabalhos em lote) são bloqueadas até que toda a resposta esteja pronta, para que o tempo de resposta completo seja sentido. Transmita qualquer coisa que um humano espere.