Как работает ценообразование LLM API

Токены, ввод и вывод, контекстные окна — почему одна и та же задача может стоить в 50 раз дороже для одной модели, чем для другой, объясняется просто.

ДомУчиться › Контекстные окна и почему длинные подсказки становятся дорогими

Контекстные окна и почему длинные подсказки становятся дорогими

Контекстное окно — это максимальный объем текста, который модель может учитывать одновременно, и это одна из наиболее неправильно понимаемых частей ценообразования ИИ. Большое окно звучит как бесплатная функция, но за каждый жетон, который вы помещаете в него, взимается плата за каждый вызов. В этом руководстве объясняется, как работает окно и почему длинные подсказки незаметно увеличивают ваш счет.

Что такое контекстное окно

Контекстное окно — это рабочая память модели для одного запроса, измеряемая в токенах. Он должен хранить все, что учитывает модель одновременно: подсказку вашей системы, любые документы или примеры, которые вы включаете, историю разговоров, текущий вопрос и место, зарезервированное для ответа модели. Вместе они должны соответствовать лимиту токенов окна.

Модели рекламируют окна разного размера: от нескольких тысяч жетонов до сотен тысяч и более. Большее окно позволяет вам загрузить больше сразу: целую книгу, большую кодовую базу, но это не меняет фундаментального правила выставления счетов: вы платите за то, что вкладываете.

Вы платите за все используемое окно, за каждый звонок

Вот та часть, которая цепляет людей. Наличие окна в 200 000 токенов не означает, что вы платите за 200 000 токенов. Это значит, что ты может используйте до этого количества, и вам будет выставлен счет за то количество, которое вы на самом деле включаете, за каждый отдельный вызов.

То есть, если вы запихнете в окно 150 000 жетонов документов и зададите 10 вопросов, вы заплатите примерно за 150 000 входных жетонов десять раз, а за 1,5 миллиона жетонов — не один раз. Окно – это потолок, а не подвеска. Длинный контекст — это мощный инструмент, но за него постоянно взимается плата за вызов.

Почему длинные подсказки быстро дорожают

Поскольку токены ввода оплачиваются за вызов, длина приглашения умножается на объем звонка. Приглашение, которое в 10 раз длиннее, требует примерно в 10 раз больше входных токенов для того же количества вызовов. Две привычки выдвигают подсказки долгое время, и люди этого не замечают:

  • Растущая история чата, возмущайтесь по полной на каждом шагу, поэтому поздние сообщения в длинном разговоре несут всю расшифровку.
  • Поиск (РАГ), где вы вставляете большие полученные документы в приглашение, чтобы указать контекст модели. Получите слишком много, и каждый запрос окупится за все.

Ни то, ни другое не является неправильным, но обеим нужна дисциплина, потому что о стоимости ничего не говорится до тех пор, пока не придет счет.

Проработанная иллюстрация

Показательный пример (придуманная ставка $3 за миллион входных токенов). Предположим, что каждый запрос включает в себя полученный контекст из 50 000 токенов. Один запрос стоит 50 000 / 1 000 000 x 3 доллара США = 0,15 доллара США только за входные данные. Выполняйте 100 000 таких запросов в месяц, и это будет стоить 15 000 долларов США только за контекст, который вы повторно отправляете, без учета затрат на выходные данные.

Теперь сократите полученный контекст до 10 000 токенов, извлекая его более выборочно. Те же 100 000 запросов стоят 3 000 долларов, в пять раз дороже, за контекст, который зачастую столь же полезен, потому что модель все равно тонет в дополнительных 40 000 токенов. Вот почему контекстная дисциплина является одним из самых эффективных средств контроля затрат, которые у вас есть.

Длинный контекст также может ухудшить качество

Больше контекста не всегда означает лучшие ответы. Модели могут потерять из виду детали, спрятанные в середине очень длинной подсказки — шаблон, в котором информация в начале и конце используется хорошо, но середина игнорируется. Таким образом, раздутое контекстное окно может стоить дороже. и дают худшие результаты.

Предоставление модели только самого актуального материала часто улучшает как счет, так и ответ. Точность важнее объема: плотный, хорошо выбранный контекст из 4000 токенов часто превосходит по производительности обширный дамп из 100 000 токенов.

Как сохранить контекст компактным

Практическая тактика контроля стоимости контекста:

  • Получайте выборочно. В RAG возвращайте только несколько наиболее релевантных фрагментов, а не все, что смутно соответствует.
  • Подведите итоги старых поворотов. Замените давно прошедший разговор кратким изложением вместо повторной отправки полной расшифровки.
  • Кэшируйте фиксированную часть. Если большой фрагмент контекста повторяется между вызовами, кэширование подсказок (см. это руководство) может сократить затраты на его повторную отправку.
  • Установите правильный размер окна. Выберите модель, окно которой соответствует вашим реальным потребностям, а не используйте по умолчанию самое большое из доступных.

Чтобы увидеть, как длина запроса соотносится с реальными деньгами для каждой модели, поместите количество своих токенов в калькулятор стоимости LLM и проверьте цены для каждого окна на страницах сравнения моделей и /models.

Часто задаваемые вопросы

Плачу ли я за полное контекстное окно модели?

Нет. Вы платите только за те токены, которые фактически включаете в каждый запрос, в пределах лимита окна. Окно имеет максимальную емкость, и каждый токен, который вы используете внутри него, оплачивается при каждом вызове.

Стоит ли большее контекстное окно дороже за токен?

Не обязательно за токен, но большее окно побуждает вас включить гораздо больше текста, а поскольку каждый токен оплачивается за вызов, более крупные подсказки увеличивают общую сумму. Некоторые провайдеры также взимают более высокие тарифы за определенную длину контекста.

Всегда ли больше контекста лучше для качества?

Нет. Модели могут упускать из виду детали, спрятанные в очень длинных подсказках, поэтому избыток контекста может как увеличить стоимость, так и снизить качество ответов. Меньший, хорошо выбранный контекст часто работает лучше.

Только образовательный, а не финансовый совет.