Все цены указаны за токен
Поставщики LLM не взимают плату за запрос или слово — они взимают плату за жетон. Токен — это фрагмент текста, примерно ¾ слова на английском языке (около 4 символов). «APICostCalc полезен» — это ~5 токенов. И текст, который вы отправляете (вход) и текст, который генерирует модель (выход) учитываются и обычно имеют цену по-другому.
Калькулятор стоимости токена →Входные данные и выходные данные: выход является самым дорогим
Практически на каждой модели выходные токены стоят дороже, чем входные токены — часто в 3–5 раз больше — потому что генерация текста требует больше вычислительных ресурсов, чем его чтение. Вот почему чат-бот, который пишет длинные ответы, стоит гораздо дороже, чем тот, который классифицирует текст в одно слово, даже при том же объеме запроса.
| Драйвер затрат | Влияние на счет |
|---|---|
| Длинное системное приглашение отправляло каждый звонок | Входные токены умножаются на количество запросов |
| Подробные ответы модели | Выходные токены — самый дорогой вид |
| Большой контекст (куски RAG, история) | Токены ввода быстро раздуваются |
| Модели рассуждения / «мышления» | Жетоны скрытых рассуждений, оплачиваемые как выходные данные |
Контекстное окно — это потолок затрат, а не свободное место.
Модель контекстное окно (например, 128 тыс. или 1 млн токенов) — это максимум, который он может прочитать за один раз, но за каждый вложенный в него токен взимается плата. каждый вызов. Вставлять целый документ в контекст каждого запроса удобно и дорого; эту проблему решают RAG и кеширование.
Стоимость контекстного окна →Стоимость токена рассуждения →Почему одна и та же задача различается в 50 раз между моделями
Модели Frontier могут стоить десятки долларов за миллион токенов; маленькие или открытые модели — несколько центов. Если дешевая модель справится с задачей приемлемого качества, одной строкой конфига можно сократить затраты на порядок. Навык позволяет сопоставить мощность модели со сложностью задачи — см. руководство по сокращению затрат.
Сравнить цены на модели →Часто задаваемые вопросы
Что такое токен в API LLM?
Токен — это небольшой фрагмент текста, который обрабатывает модель. На английском языке это примерно ¾ слова или около 4 символов. Поставщики выставляют счет за токен как за текст, который вы отправляете (вход), так и за текст, который генерирует модель (выход).
Почему выходные токены стоят дороже, чем входные?
Генерация текста требует больше вычислений, чем его чтение, поэтому провайдеры оценивают токены вывода выше — обычно в 3–5 раз больше скорости ввода. Это делает подробные ответы модели основным источником затрат.
Стоит ли большее контекстное окно дороже?
Только для токенов, которые вы действительно используете. Окно имеет максимальную емкость, но каждый токен, который вы помещаете в контекст, оплачивается при каждом вызове, поэтому повторная отправка больших запросов быстро становится дорогостоящей.
Как та же задача может стоить в 50 раз дороже на одной модели?
Цены на модели за миллион токенов сильно различаются между пограничными и малыми/открытыми моделями. Если более дешевая модель соответствует вашей планке качества для данной задачи, переход на нее может сократить расходы на порядок.
Только образовательная информация — цены являются приблизительными; подтвердите текущие тарифы на странице цен каждого поставщика.