Как работает ценообразование LLM API

Токены, ввод и вывод, контекстные окна — почему одна и та же задача может стоить в 50 раз дороже для одной модели, чем для другой, объясняется просто.

ДомУчиться › Сколько на самом деле стоит точная настройка

Сколько на самом деле стоит точная настройка

Точная настройка, дальнейшее обучение базовой модели на собственных примерах часто позиционируется как способ сделать модель ИИ по-настоящему вашей. Что замалчивается, так это стоимость, которая состоит из нескольких частей, некоторые из которых очевидны, а некоторые скрыты. В этом руководстве подробно описано, за что вы на самом деле платите, чтобы вы могли оценить, лучше ли это просто написать более качественную подсказку.

Точная настройка имеет три уровня затрат.

Общая стоимость доводки не является однозначной цифрой. Он распадается на три отдельные части:

  • Стоимость обучения, единовременная плата за выполнение задания по точной настройке, обычно взимаемая за токен в наборе обучающих данных, иногда умноженная на количество проходов (эпох) обработки данных.
  • Стоимость вывода, сколько вы платите каждый раз, когда впоследствии вызываете доработанную модель. Часто эта сумма на токен выше, чем у базовой модели.
  • Стоимость подготовки данных, человеческие усилия по созданию, очистке и форматированию высококачественного обучающего набора. Часто это самая большая стоимость, и она не отображается ни в одном счете.

Пропуск любого из этих пунктов приведет к неприятному сюрпризу позже.

Стоимость обучения

Обучение оплачивается в зависимости от объема введенных вами данных. Если ваш набор данных составляет 1 миллион токенов и модель обучается в течение 3 эпох, вам будет выставлен счет так, как если бы вы обработали 3 миллиона токенов со скоростью обучения. Таким образом, решающую роль играют как размер набора данных, так и количество эпох.

Вот наглядный пример (придуманная ставка). При цене обучения 8 долларов США за миллион токенов набор данных из 1 миллиона токенов за 3 эпохи стоит 3 x 8 долларов США = 24 доллара США за обучающий прогон. Эта часть часто оказывается дешевле, чем люди ожидают. Подвох в том, что будет потом.

Постоянная премия за вывод

Запуск точно настроенной модели обычно обходится дороже в расчете на один токен, чем базовая модель, на основе которой она была построена. Это цена, которая никогда не прекращается. Если вы совершаете миллионы звонков в месяц, более высокая скорость вывода может во много раз затмить единовременную плату за обучение.

Показательный пример: если базовая модель обслуживает 1 доллар за миллион входных токенов, а доработанная версия стоит 3 доллара за миллион, то при большом объеме вы платите тройную цену за каждый отдельный вызов, навсегда. Перед точной настройкой всегда моделируйте текущие затраты на вычисление исходя из ожидаемого объема вызовов, а не только стоимость обучения. Калькулятор стоимости LLM и страницы сравнения моделей помогут вам сопоставить базовую ставку и точно настроенную ставку.

Скрытые затраты: подготовка данных

Качество точной настройки зависит от данных обучения. Обычно вам нужны сотни или тысячи пар высококачественных примеров, каждая из которых показывает входные данные и идеальный результат. Создание таких примеров и их проверка на правильность и последовательность — это квалифицированная человеческая работа, которая может занять дни или недели.

Эти усилия редко фигурируют в сметах затрат, однако зачастую они представляют собой самые большие реальные затраты. Точная настройка, обученная на беспорядочных или противоречивых данных, может работать хуже, чем базовая модель, а это означает, что вы заплатили за обучение и получили понижение версии. Запланируйте реалистичное человеческое время на обработку данных или не начинайте.

Когда точная настройка того стоит, а когда нет

Точная настройка имеет тенденцию окупаться, когда вам нужно последовательный стиль, формат или поведение это сложно указать в подсказке, когда вы хотите сократить подсказки (точно настроенная модель может не нуждаться в длинных инструкциях или примерах, сохраняя входные токены при каждом вызове) или когда у вас узкая, объемная задача, где меньшая точно настроенная модель может заменить более дорогую.

Обычно оно того не стоит, если ваша задача часто меняется (каждое изменение означает переобучение), когда у вас слишком мало хороших примеров или когда тщательные подсказки и поиск уже приводят вас к цели. Для большинства команд честным первым шагом будет исчерпать подсказки и кэширование подсказок, прежде чем переходить к тонкой настройке.

Сравните общую стоимость обоих путей.

Справедливое сравнение — это общая стоимость за реальный период использования. Путь A: базовая модель с более длинной, тщательно продуманной подсказкой, большим количеством входных токенов за вызов, но без затрат на обучение и стандартными показателями вывода. Путь Б: точно настроенная модель с более короткими подсказками, но платой за обучение и более высокой скоростью вывода.

Сложите каждый путь, скажем, за год ожидаемых звонков. Иногда более короткие подсказки для точной настройки выигрывают; часто путь «базовая модель с хорошим подсказкой» дешевле и гораздо более гибок. Перед фиксацией пропустите оба варианта с помощью калькулятора стоимости LLM, используя собственное количество токенов, потому что ответ меняется в зависимости от объема.

Часто задаваемые вопросы

Является ли тонкая настройка единовременной затратой?

Нет. Обучение взимается единоразово, но запуск точно настроенной модели обычно обходится дороже в расчете на один токен, чем базовая модель, поэтому вы продолжаете платить надбавку за каждый вызов до тех пор, пока используете ее.

Сколько тренировочных данных мне нужно?

Это зависит от задачи, но обычно встречаются от сотен до нескольких тысяч пар качественных примеров. Качество и последовательность имеют гораздо большее значение, чем исходное количество, и подготовка этих данных часто является самой большой реальной затратой.

Должен ли я выполнить точную настройку или просто улучшить свое приглашение?

Сначала попробуйте подсказки, несколько примеров и извлечение информации. Точная настройка имеет смысл в основном для единообразного форматирования или узких задач большого объема, где более короткие подсказки компенсируют более высокую скорость вывода.

Только образовательный, а не финансовый совет.