So funktioniert dieser Rechner
Der LLM-Latenz- und Reaktionszeitrechner schätzt die Gesamtzeit, die ein Benutzer auf die Antwort eines Modells wartet, nicht einen Dollarwert. Es vereint drei Treiber: die Zeit bis zum ersten Token (die anfängliche Verzögerung in Millisekunden, bevor eine Ausgabe erscheint), die Generationsgeschwindigkeit in Token pro Sekunde und die Anzahl der Ausgabetoken in der Antwort. Die Gesamtantwortzeit ist ungefähr die Verzögerung des ersten Tokens plus Ausgabe-Tokens geteilt durch die Generierungsgeschwindigkeit und die Anfragen pro Minute Die Eingabe rahmt dies für einen einzelnen Stream ein, sodass Sie sehen können, wie sich die Erfahrung eines Benutzers skaliert.
Der wichtigste Kompromiss besteht darin Die Gesamtlatenz wächst mit der Antwortlänge: Ein schnelles Modell kann sich immer noch langsam anfühlen, wenn es lange Antworten generiert, und eine kurze Zeit bis zum ersten Token ist bei kurzen Antworten am wichtigsten, bei denen Benutzer die anfängliche Pause bemerken. Entscheiden Sie beim Tuning, ob wahrgenommene Reaktionsfähigkeit (schneller erster Token) oder Fertigstellungszeit (kurze, schnelle Ausgabe) ist für Ihren Anwendungsfall wichtiger und kürzen Sie Eingabeaufforderungen oder begrenzen Sie Ausgabetokens, um die Wartezeiten akzeptabel zu halten.
Häufig gestellte Fragen
Was bestimmt die LLM-Reaktionszeit?
Zwei Dinge: Zeit bis zum ersten Token (TTFT) – die Wartezeit, bevor das Streaming beginnt, typischerweise 0,3–2 Sekunden und mehr für Reasoning-Modelle – und Token pro Sekunde, die Generierungsrate. Gesamtzeit = TTFT + (Ausgabe-Tokens ÷ Tokens pro Sekunde). Die Eingabelänge beeinflusst hauptsächlich die TTFT, die Ausgabelänge beeinflusst die Generierung.
Warum fühlt sich Streaming schneller an, als die Zahl sagt?
Da Benutzer Token beim Streamen lesen, entspricht die wahrgenommene Latenz eher der TTFT als der Gesamtzeit. Nicht gestreamte Antworten (strukturiertes JSON, Toolaufrufe, Batch-Jobs) blockieren, bis die gesamte Antwort fertig ist, sodass die volle Antwortzeit spürbar ist. Streamen Sie alles, worauf ein Mensch wartet.