Como funciona esta calculadora
O Calculadora de latência e tempo de resposta LLM estima o tempo total que um usuário espera pela resposta de um modelo, não um valor monetário. Combina três drivers: o hora do primeiro token (o atraso inicial em milissegundos antes de qualquer saída aparecer), o velocidade de geração em tokens por segundo, e o número de tokens de saída na resposta. O tempo total de resposta é aproximadamente o atraso do primeiro token mais os tokens de saída dividido pela velocidade de geração, e o solicitações por minuto input enquadra isso para um único fluxo para que você possa ver como a experiência de um usuário é dimensionada.
A principal compensação é que a latência total cresce com o comprimento da resposta: um modelo rápido ainda pode parecer lento se gerar respostas longas, e um tempo baixo para o primeiro token é mais importante para respostas curtas em que os usuários percebem a pausa inicial. Ao sintonizar, decida se capacidade de resposta percebida (primeiro token rápido) ou tempo de conclusão (saída curta e rápida) é mais importante para o seu caso de uso e reduza os prompts ou limite os tokens de saída para manter as esperas aceitáveis.
Perguntas frequentes
O que determina o tempo de resposta do LLM?
Duas coisas: tempo até o primeiro token (TTFT) – a espera antes do início do streaming, normalmente 0,3–2s ou mais para modelos de raciocínio – e tokens por segundo, a taxa de geração. Tempo total = TTFT + (tokens de saída ÷ tokens por segundo). O comprimento de entrada afeta principalmente o TTFT, o comprimento de saída afeta a geração.
Por que o streaming parece mais rápido do que o número indica?
Como os usuários leem os tokens à medida que fazem streaming, a latência percebida é próxima do TTFT, e não do tempo total. As respostas não transmitidas (JSON estruturado, chamadas de ferramentas, trabalhos em lote) são bloqueadas até que toda a resposta esteja pronta, para que o tempo de resposta completo seja sentido. Transmita qualquer coisa que um humano espere.