Объяснение токенов и запросов

Что на самом деле представляет собой токен, чем он отличается от запроса API и как оценить и то, и другое перед созданием.

ДомУчиться › Объяснение токенов и запросов

Запрос и токен — это не одно и то же

Ан API-запрос это один вызов конечной точки. Токены — это единицы текста внутри этого вызова. Один запрос может содержать несколько токенов или сотни тысяч. Поставщики LLM выставляют счета в токенах; многие другие API (платежи, карты, SMS) выставляют счет за запрос или за действие. Смешение этих двух факторов является наиболее распространенной ошибкой при составлении бюджета.

Где применяется каждая модель

Тип APIОставил счет
LLM/ИИ (OpenAI, Anthropic и т. д.)Токены (вход + вывод)
ВложенияТокены (только ввод)
Генерация изображенийЗа изображение/за шаг
Карты, поиск, СМС, платежиЗа запрос/за действие
Стоимость всего вашего стека API →

Как оценить перед строительством

Для функции LLM оцените: токенов на звонок × звонки на пользователя × пользователей. Ответ в чате может составлять ~500 входных + ~300 выходных токенов; умножьте на ежемесячные разговоры, чтобы получить объем токенов, а затем оцените его. Это гораздо точнее, чем угадывание «по запросу», поскольку количество токенов на запрос сильно варьируется. На протяжении всего процесса ввод и вывод должны быть разделены — поставщики оценивают их по-разному, часто в 3–5 раз, поэтому смешанная оценка «среднего токена» может существенно отличаться.

Стоимость токена →Стоимость контекстного окна →

То же разделение снова проявляется в ограничениях ставок.

Большинство поставщиков LLM ограничивают использование оба оси одновременно: потолок запросов в минуту (RPM) и потолок токенов в минуту (TPM). Какой из них вы нажмете первым, полностью зависит от того, сколько токенов несет ваш средний вызов — точное количество, о котором рассказывается на этой странице.

Знание того, какой предел вы достигнете, меняет решение: рабочая нагрузка, привязанная к RPM, выигрывает от пакетирование несколько небольших вызовов в один более крупный запрос (меньше запросов, общее количество токенов), в то время как рабочая нагрузка с привязкой к TPM выигрывает от обрезка контекста или длины вывода вместо уменьшения частоты вызовов. Видеть Объяснение ограничений скорости API для конкретных уровней RPM/TPM по поставщикам.

Рабочий пример: определение размера функции чат-бота

Допустим, вы планируете создать чат-бот службы поддержки для 5000 активных пользователей в месяц, каждое усреднение 2 сеанса/месяц из 3 хода кусок. Каждый поворот несет примерно 900 входных жетонов (системное приглашение + история последних разговоров + сообщение пользователя) и 250 выходных жетонов.

Проведите общие входные и выходные данные с помощью калькулятора стоимости токенов отдельно для выбранной вами модели — поскольку выходные данные имеют более высокую цену, выходные токены 10 млн могут стоить столько же, сколько входные токены 24,5 млн, даже если это треть объема.

Калькулятор стоимости чат-бота →

Распространенные ошибки, которые приводят к срыву оценки

Продолжить обучение

Как работает ценообразование LLM API →Ограничения скорости API →Глоссарий стоимости AI и API →

Часто задаваемые вопросы

В чем разница между токеном и запросом API?

Запрос API — это одиночный вызов конечной точки; токены — это единицы текста внутри него. Один запрос может содержать очень мало или сотни тысяч токенов. LLM выставляют счет за токен, в то время как многие другие API выставляют счет за запрос.

Сколько токенов содержит типичное сообщение чат-бота?

Короткое сообщение пользователя плюс системное приглашение часто составляет несколько сотен входных токенов, а ответ — несколько сотен выходных токенов — примерно 500–1000 токенов на обмен, хотя это зависит от длины приглашения и многословности ответа.

Как оценить ежемесячное использование токенов?

Умножьте токены за вызов на количество вызовов на пользователя и на количество пользователей. Оцените входные и выходные токены отдельно, поскольку они оцениваются по-разному, а затем просчитайте общую сумму с помощью калькулятора стоимости токенов для выбранной вами модели.

Стоит ли токен одинаково, независимо от того, является ли он вводом или выводом?

Нет — выходные токены обычно стоят дороже, чем входные токены для той же модели, часто в 3–5 раз дороже. Разделение общих затрат и результатов, а не смешивание их в одно среднее значение дает гораздо более точную оценку затрат.

На что еще, кроме токенов основной модели, мне следует заложить бюджет?

В конвейере RAG или агента бюджет на встраивание запросов, векторных запросов к базе данных и любые более мелкие вызовы модели маршрутизации или классификации — каждый из них оплачивается отдельно от токенов основной модели и может суммироваться в рамках крупномасштабной функции.

Ограничения скорости учитывают запросы или токены?

Обычно и то и другое одновременно — провайдеры устанавливают отдельное ограничение количества запросов в минуту (RPM) и количества токенов в минуту (TPM), и вы выбираете тот из них, который первым насыщает ваш шаблон трафика. Высокочастотные короткие звонки обычно сначала достигают числа оборотов в минуту; низкочастотные вызовы с длинным контекстом обычно сначала достигают TPM.

Только образовательная информация — цены являются приблизительными; подтвердите текущие тарифы на странице цен каждого поставщика.

Tools & Hosting

📈 TradingView🔒 NordVPN💳 RevolutDigitalOcean $200Hostinger