Запрос и токен — это не одно и то же
Ан API-запрос это один вызов конечной точки. Токены — это единицы текста внутри этого вызова. Один запрос может содержать несколько токенов или сотни тысяч. Поставщики LLM выставляют счета в токенах; многие другие API (платежи, карты, SMS) выставляют счет за запрос или за действие. Смешение этих двух факторов является наиболее распространенной ошибкой при составлении бюджета.
Где применяется каждая модель
| Тип API | Оставил счет |
|---|---|
| LLM/ИИ (OpenAI, Anthropic и т. д.) | Токены (вход + вывод) |
| Вложения | Токены (только ввод) |
| Генерация изображений | За изображение/за шаг |
| Карты, поиск, СМС, платежи | За запрос/за действие |
Как оценить перед строительством
Для функции LLM оцените: токенов на звонок × звонки на пользователя × пользователей. Ответ в чате может составлять ~500 входных + ~300 выходных токенов; умножьте на ежемесячные разговоры, чтобы получить объем токенов, а затем оцените его. Это гораздо точнее, чем угадывание «по запросу», поскольку количество токенов на запрос сильно варьируется. На протяжении всего процесса ввод и вывод должны быть разделены — поставщики оценивают их по-разному, часто в 3–5 раз, поэтому смешанная оценка «среднего токена» может существенно отличаться.
Стоимость токена →Стоимость контекстного окна →То же разделение снова проявляется в ограничениях ставок.
Большинство поставщиков LLM ограничивают использование оба оси одновременно: потолок запросов в минуту (RPM) и потолок токенов в минуту (TPM). Какой из них вы нажмете первым, полностью зависит от того, сколько токенов несет ваш средний вызов — точное количество, о котором рассказывается на этой странице.
- Короткие звонки, высокая частота (например, классификатор, срабатывающий при каждом нажатии клавиши), как правило, попадает в об/мин cap first — каждый звонок стоит дешево в токенах, но их много.
- Длинные звонки, низкая частота (например, конечная точка суммирования документов с контекстом из 20 тысяч токенов), как правило, попадают в ТРМ сначала cap — несколько звонков уже могут насытить бюджет токена.
Знание того, какой предел вы достигнете, меняет решение: рабочая нагрузка, привязанная к RPM, выигрывает от пакетирование несколько небольших вызовов в один более крупный запрос (меньше запросов, общее количество токенов), в то время как рабочая нагрузка с привязкой к TPM выигрывает от обрезка контекста или длины вывода вместо уменьшения частоты вызовов. Видеть Объяснение ограничений скорости API для конкретных уровней RPM/TPM по поставщикам.
Рабочий пример: определение размера функции чат-бота
Допустим, вы планируете создать чат-бот службы поддержки для 5000 активных пользователей в месяц, каждое усреднение 2 сеанса/месяц из 3 хода кусок. Каждый поворот несет примерно 900 входных жетонов (системное приглашение + история последних разговоров + сообщение пользователя) и 250 выходных жетонов.
- Жетонов за ход: 900 + 250 = 1,150
- Оборотов на пользователя в месяц: 3 × 2 = 6
- Токенов на пользователя/месяц: 1150 × 6 = 6,900 (≈4900 входных / 1500 выходных)
- Всего токенов за месяц: 6900 × 5000 = 34,5 млн. (≈24,5 МБ на входе / ~10 МБ на выходе)
Проведите общие входные и выходные данные с помощью калькулятора стоимости токенов отдельно для выбранной вами модели — поскольку выходные данные имеют более высокую цену, выходные токены 10 млн могут стоить столько же, сколько входные токены 24,5 млн, даже если это треть объема.
Калькулятор стоимости чат-бота →Распространенные ошибки, которые приводят к срыву оценки
- Объединение затрат и выпуска в одну цену. Выходные токены обычно в 3–5 раз превышают входную ставку — оценка обоих по входной цене занижает счет.
- Забывая недавнюю историю. Многоходовой чат, который повторно отправляет предыдущие сообщения при каждом вызове, означает, что количество токенов за ход увеличивается в течение сеанса, а не только в каждом сообщении.
- Оценка по символам, а не по токенам. Количество токенов на символ зависит от языка и контента — в коде, JSON и неанглийском тексте обычно используется больше токенов на символ, чем в простом английском языке.
- Игнорирование повторных попыток. Неудачный вызов, который повторяется, по-прежнему потребляет квоту запросов, а часто и токены, поэтому подверженная ошибкам интеграция обходится дороже, чем предполагает математика счастливого пути.
- Пропуская остальную часть конвейера. Функция RAG или агента обычно добавляет запросы на внедрение, вызовы с векторным поиском, а иногда и меньшую модель маршрутизации — каждая из которых оплачивается отдельно, отдельно от токенов основной модели.
Продолжить обучение
Как работает ценообразование LLM API →Ограничения скорости API →Глоссарий стоимости AI и API →Часто задаваемые вопросы
В чем разница между токеном и запросом API?
Запрос API — это одиночный вызов конечной точки; токены — это единицы текста внутри него. Один запрос может содержать очень мало или сотни тысяч токенов. LLM выставляют счет за токен, в то время как многие другие API выставляют счет за запрос.
Сколько токенов содержит типичное сообщение чат-бота?
Короткое сообщение пользователя плюс системное приглашение часто составляет несколько сотен входных токенов, а ответ — несколько сотен выходных токенов — примерно 500–1000 токенов на обмен, хотя это зависит от длины приглашения и многословности ответа.
Как оценить ежемесячное использование токенов?
Умножьте токены за вызов на количество вызовов на пользователя и на количество пользователей. Оцените входные и выходные токены отдельно, поскольку они оцениваются по-разному, а затем просчитайте общую сумму с помощью калькулятора стоимости токенов для выбранной вами модели.
Стоит ли токен одинаково, независимо от того, является ли он вводом или выводом?
Нет — выходные токены обычно стоят дороже, чем входные токены для той же модели, часто в 3–5 раз дороже. Разделение общих затрат и результатов, а не смешивание их в одно среднее значение дает гораздо более точную оценку затрат.
На что еще, кроме токенов основной модели, мне следует заложить бюджет?
В конвейере RAG или агента бюджет на встраивание запросов, векторных запросов к базе данных и любые более мелкие вызовы модели маршрутизации или классификации — каждый из них оплачивается отдельно от токенов основной модели и может суммироваться в рамках крупномасштабной функции.
Ограничения скорости учитывают запросы или токены?
Обычно и то и другое одновременно — провайдеры устанавливают отдельное ограничение количества запросов в минуту (RPM) и количества токенов в минуту (TPM), и вы выбираете тот из них, который первым насыщает ваш шаблон трафика. Высокочастотные короткие звонки обычно сначала достигают числа оборотов в минуту; низкочастотные вызовы с длинным контекстом обычно сначала достигают TPM.
Только образовательная информация — цены являются приблизительными; подтвердите текущие тарифы на странице цен каждого поставщика.