Как работает этот калькулятор
Бесплатный калькулятор задержки LLM — выходные токены, скорость генерации и время до первого токена, а также реальное время отклика, которое ощутят ваши пользователи.
Часто задаваемые вопросы
Что определяет время ответа LLM?
Две вещи: время появления первого токена (TTFT) — время ожидания перед началом потоковой передачи, обычно 0,3–2 с и выше для моделей рассуждения — и токены в секунду, скорость генерации. Общее время = TTFT + (выходные токены ÷ токены в секунду). Входная длина в основном влияет на TTFT, выходная длина влияет на генерацию.
Почему потоковая передача ощущается быстрее, чем указано в цифрах?
Поскольку пользователи считывают токены по мере их поступления, воспринимаемая задержка близка к TTFT, а не к общему времени. Непотоковые ответы (структурированный JSON, вызовы инструментов, пакетные задания) блокируются до тех пор, пока не будет готов весь ответ, поэтому ощущается полное время ответа. Транслируйте все, чего ждет человек.