Come funziona questa calcolatrice
IL Calcolatore della latenza e del tempo di risposta LLM stima il tempo totale che un utente attende affinché un modello risponda, non una cifra in dollari. Combina tre driver: il tempo per il primo gettone (il ritardo iniziale in millisecondi prima che venga visualizzato qualsiasi output), il velocità di generazione in token al secondo e il numero di gettoni di uscita nella risposta. Il tempo di risposta totale corrisponde all'incirca al ritardo del primo token più i token di output diviso per la velocità di generazione e il richieste al minuto input lo inquadra per un singolo flusso in modo da poter vedere come si ridimensiona l'esperienza di un utente.
Il compromesso chiave è questo la latenza totale cresce con la lunghezza della risposta: un modello veloce può comunque sembrare lento se genera risposte lunghe e un tempo basso per il primo token è più importante per le risposte brevi in cui gli utenti notano la pausa iniziale. Durante l'accordatura, decidi se reattività percepita (primo gettone veloce) o tempo di completamento (output breve e veloce) è più importante per il tuo caso d'uso e accorcia i prompt o limita i token di output per mantenere le attese accettabili.
Domande frequenti
Cosa determina il tempo di risposta LLM?
Due cose: il tempo al primo token (TTFT) - l'attesa prima dell'inizio dello streaming, in genere 0,3–2 s e superiore per i modelli di ragionamento - e i token al secondo, il tasso di generazione. Tempo totale = TTFT + (gettoni in uscita ÷ gettoni al secondo). La lunghezza dell'input influisce principalmente sul TTFT, la lunghezza dell'output influisce sulla generazione.
Perché lo streaming sembra più veloce di quanto indicato dal numero?
Poiché gli utenti leggono i token durante lo streaming, la latenza percepita è vicina al TTFT anziché al tempo totale. Le risposte non trasmesse in streaming (JSON strutturato, chiamate a strumenti, lavori batch) si bloccano finché l'intera risposta non è pronta, quindi viene percepito il tempo di risposta completo. Trasmetti in streaming tutto ciò che un essere umano aspetta.