Потолок RPM и TPM для вашего размера токена
Меньшая полоска — это та, которая вас на самом деле душит.
| Лимит | Ценить | Макс.треб./мин. | Связывает? |
|---|
Почему два ограничения и почему это важно
Каждый крупный провайдер LLM — OpenAI, Anthropic, Google, Mistral — измеряет ваши показатели. запросов в минуту и жетонов в минуту одновременно. Загвоздка в том, что большинство людей забывают об ограничении токенов. Бюджет в 30 000 TPM кажется большим, пока вы не отправите запросы на 4 000 токенов: это всего лишь около 7 запросов в минуту, прежде чем вы начнете получать 429 Too Many Requests, даже несмотря на то, что предел числа оборотов в минуту может допускать сотни. Исправление почти никогда не заключается в «отправке быстрее» — это обрезка контекста, ограничение длины вывода или повышение уровня использования.
Этот калькулятор сделает деление за вас. Он берет и лимиты, и ваши токены за каждый запрос, находит меньший потолок и превращает его во что-то, что вы можете спланировать: одновременно активные пользователи. Если вы знаете, что каждый пользователь отправляет примерно два запроса в минуту, номер пользователя покажет вам, скольким людям обслуживает один ключ до того, как запросы пойдут в очередь. Когда вы упираетесь в стену, честные варианты: уменьшить подсказку (часто самый большой рычаг), сократить max_tokens, пакетные несрочные работы по асинхронный пакетный APIили получить право на более высокий уровень, потратив больше.
Как только пропускная способность будет определена, оцените ее: Калькулятор стоимости токена LLM превращает эти токены в доллары, а Оценщик стоимости приложения с искусственным интеллектом моделирует весь счет с учетом вашего количества пользователей. Создаете чат-продукт? калькулятор стоимости чат-бота связывает объем разговоров как со стоимостью, так и с пропускной способностью.
Как его использовать
1. Выберите предустановленный уровень или введите ограничения RPM и TPM на панели управления вашего провайдера.
2. Введите входные и выходные токены, которые используются в типичном запросе (выходные данные также учитываются в TPM).
3. Установите, сколько запросов отправляет один активный пользователь в минуту.
4. Узнайте количество эффективных запросов в минуту, количество одновременных пользователей и какой предел является узким местом.
Распространенные ошибки
Подсчет только входных токенов. Выходные токены также оплачиваются и имеют ограниченную скорость — болтливая модель с длинными ответами быстро сжигает TPM. Выбор размера по пределу числа оборотов. Если ваши запросы большие, TPM сначала ограничивает их; число оборотов не имеет значения. Предположим, что лимит фиксирован. Уровни повышаются автоматически по мере роста ваших расходов, поэтому сегодняшняя стена может исчезнуть в следующем месяце. Игнорирование всплесков. Ограничения указаны в среднем за минуту, но применяются в коротких окнах, поэтому резкий трафик достигает 429 секунд ниже среднего.
Только оценить. Ограничения по ставкам являются справочными цифрами и различаются в зависимости от поставщика, модели и уровня учетной записи. Проверьте это на своей панели управления.