HomeBlog › Почему приложения LLM достигают предела скорости 429

Почему ваше приложение LLM выдает 429 ошибок — математику TPM никто не объясняет

Опубликовано 28 июня 2026 г. · справочные лимиты, проверьте на панели управления вашего провайдера.

Вы читаете документы. Ваш уровень позволяет 500 запросов в минуту. Вы посылаете, может быть, восемь. И все же журналы полны 429 Too Many Requests. С вашим кодом все в порядке — вы попадаете в другой предел, который пропускают большинство руководств: токенов в минуту (TPM). Каждый крупный провайдер LLM одновременно измеряет RPM и TPM и фактически подсказывает, что лимит токенов почти всегда кусается первым.

Два предела, и тот, который на самом деле связывает

Возьмем начальный уровень OpenAI для GPT-4o: примерно 500 об/мин и 30 000 транзакций в минуту (справка, июнь 2026 г.). Число оборотов в минуту выглядит щедрым. Но запрос, дополненный поиском и вставленный в него несколькими документами, может быть легко 4000 жетонов в и 500 из — назовем это 4500 токенов за запрос. Теперь выполните разделение, которого нет в документах:

ЛимитЦенитьМаксимальное количество запросов в минуту при 4500 токенов
Число оборотов в минуту (запросов/мин)500500
TPM (токены/мин)30,0006.7 ◀ привязывается

Цены являются ориентировочными на июль 2026 года. Сообщить об устаревшей цене →

Итак, ваш настоящий потолок менее семи запросов в минуту, а не 500. Лимит токенов ограничивает вас на уровне 1,3% от того, что подразумевает лимит запросов. Вот почему 429-е начинаются с однозначного трафика и почему «отправлять медленнее» или «добавлять повтор» лечит симптом, а не причину.

Превратите ограничение во что-то, что вы можете планировать: количество одновременных пользователей

Количество запросов в минуту абстрактно. Что вы на самом деле хотите знать, так это сколько человек могут использовать приложение одновременно. Если каждый активный пользователь отправляет примерно два запроса в минуту, потолок в 6,7 об/мин составляет примерно три одновременных пользователя до того, как запросы начнут стоять в очереди. Прекрасно для демо-версии; стена для запуска. Исправление редко представляет собой более быстрый цикл — это один из четырех рычагов:

Это не только OpenAI

Одна и та же ловушка существует повсюду, иногда даже посерьезнее. Уровень Клода для Anthropic уже близко 50 об/мин / 40 000 т/мин; Бесплатный уровень Gemini 2.5 Flash от Google щедр на токены (~ 250 000 TPM), но скуп на запросы (~ 10 RPM). Предел привязки меняется в зависимости от того, большие ли у вас подсказки или резкий трафик — именно поэтому одно эмпирическое правило не работает. Вам нужно подключиться твой размер токена.

Вот что такое наша новая Калькулятор ограничения скорости Что делает: введите уровень (или ваш реальный TPM/RPM), ваши входные и выходные токены, а также частоту звонков каждого пользователя, а также количество эффективных запросов в минуту, количество одновременных пользователей, которых вы можете обслуживать, и какой предел является узким местом. Это самый быстрый способ узнать, не застрянет ли запуск, раньше, чем это сделают ваши пользователи.

Вывод

429 ошибок ниже вашего предела RPM не являются ошибкой — это ограничение количества токенов в минуту, выполняющее свою работу. Размер емкости на жетоны, не учитывается запрос; обрезать контекст перед повторными попытками; и помните, что лимит увеличивается с увеличением расходов. Как только вы узнаете свой реальный потолок, оцените трафик с помощью Калькулятор стоимости токена LLM и смоделировать все приложение на Оценщик стоимости приложения с искусственным интеллектом.

Ограничения по ставкам являются справочными цифрами (июнь 2026 г.) и различаются в зависимости от поставщика, модели и уровня учетной записи. Всегда подтверждайте это на своей панели управления. Связанный: Калькулятор лимита ставки · Экономия пакетного API · Самый дешевый API LLM.