So funktioniert dieser Rechner
Kostenloser LLM-Latenzrechner – Ausgabe-Token, Generierungsgeschwindigkeit und Zeit bis zum ersten Token bis hin zur tatsächlichen Antwortzeit, die Ihre Benutzer spüren werden.
Häufig gestellte Fragen
Was bestimmt die LLM-Reaktionszeit?
Zwei Dinge: Zeit bis zum ersten Token (TTFT) – die Wartezeit, bevor das Streaming beginnt, typischerweise 0,3–2 Sekunden und mehr für Reasoning-Modelle – und Token pro Sekunde, die Generierungsrate. Gesamtzeit = TTFT + (Ausgabe-Tokens ÷ Tokens pro Sekunde). Die Eingabelänge beeinflusst hauptsächlich die TTFT, die Ausgabelänge beeinflusst die Generierung.
Warum fühlt sich Streaming schneller an, als die Zahl sagt?
Da Benutzer Token beim Streamen lesen, entspricht die wahrgenommene Latenz eher der TTFT als der Gesamtzeit. Nicht gestreamte Antworten (strukturiertes JSON, Toolaufrufe, Batch-Jobs) blockieren, bis die gesamte Antwort fertig ist, sodass die volle Antwortzeit spürbar ist. Streamen Sie alles, worauf ein Mensch wartet.