—
экономия при аренде графического процессора по сравнению с управляемым API—стоимость управляемого провайдера
—Стоимость аренды графического процессора
—Требуются часы работы графического процессора
Ставки управляемых поставщиков по сравнению с арендой графического процессора, в зависимости от размера вашего набора данных
То же количество обучающих токенов, что указано выше (набор данных × среднее количество токенов × эпохи), цена которого рассчитывается на основе опубликованной ставки LoRA каждого управляемого поставщика рядом с настройками аренды вашего графического процессора.
| Вариант | Ставка | Стоимость обучения |
|---|
Стоимость в зависимости от размера набора данных
Все остальное соответствует значениям, указанным выше, с учетом размера набора данных (обучающие примеры), сравнивая выбранную управляемую ставку с настройками аренды вашего графического процессора. Выделенная строка наиболее близка к текущему размеру набора данных.
| Примеры | Жетоны обучения | Управляемая стоимость | Стоимость графического процессора | Более дешевый вариант |
|---|
Как это связано с другими инструментами
Этот калькулятор оценивает одно конкретное решение: платить ли ставку управляемого провайдера за токен за обучение LoRA/QLoRA или арендовать графический процессор самостоятельно и запустить задание напрямую. Если ваша работа – это полный точная настройка — обновление каждого параметра, а не небольшого набора адаптеров низкого ранга — это совершенно другая форма затрат, рассчитанная по сравнению с собственными ставками обучающих жетонов OpenAI, Google и Mistral на точная настройка калькулятора стоимости; полную стоимость тонкой настройки для этих поставщиков см. в этом инструменте вместо этого. Если вы предпочитаете точную настройку, а не просто предложение базовой модели, то Калькулятор быстрой и точной настройки и RAG против тонкой настройки страницы посвящены этому более раннему решению. И как только модель, настроенная на LoRA, будет обучена, ее долгосрочная эксплуатация — это отдельный вопрос «сборка против покупки». самостоятельный калькулятор LLM и API оценивает это текущее решение вывода так же, как на этой странице оценивается единовременное решение по обучению.
Как работает этот калькулятор
The Точная настройка LoRA/QLoRA: калькулятор аренды управляемого API и графического процессора начинается от общей учебной нагрузки: размер набора данных (обучающие примеры) × среднее количество токенов на пример × эпохи дает общее количество жетоны обучения задание должно быть обработано — по умолчанию 50 000 × 512 × 2 — это 51 200 000 токенов обучения. На управляемой стороне количество токенов делится на 1 000 000 и умножается на число выбранных провайдеров. ставка за 1 миллион токенов обучения дает стоимость управляемого провайдера — 24,58 доллара США по умолчанию Together AI. Что касается аренды графического процессора, то же количество обучающих токенов делится на (пропускная способность обучения в токенах/сек × 3600) дает Часы работы графического процессора необходимое, которое умножается на Скорость графического процессора в час дает чистую стоимость вычислений; добавление часы настройки × ваша почасовая ставка (необязательно, по умолчанию $0) дает полную Стоимость аренды графического процессора — около 1,79 доллара США по умолчанию для A100 при стоимости установки 0 долларов США.
Вычитание стоимости графического процессора из управляемой стоимости дает сбережения от аренды графического процессора самостоятельно, и деление этой суммы на управляемую стоимость дает разрыв в стоимости процент — примерно на 92,7% дешевле за счет аренды графического процессора по умолчанию. Это может стать отрицательным: если ваша оценка пропускной способности слишком низкая, частота вашего графического процессора слишком высока или вы установили ненулевую почасовую ставку для достаточного количества часов установки, управляемый API может оказаться дешевле, и этот калькулятор показывает это честно, а не предполагает, что DIY всегда выигрывает. пропускная способность обучения Поле — это самый чувствительный входной параметр — оно сильно варьируется в зависимости от количества параметров модели, поэтому значение по умолчанию в 15 000 токенов/сек — это лишь начальная оценка; замените его числом, основанным на фактическом размере вашей модели и графическом процессоре, прежде чем доверять долларовому результату для реального решения по бюджету.
Часто задаваемые вопросы
Тонкая настройка LoRA дешевле через API или аренда графического процессора?
При типичных размерах наборов данных аренда графического процессора самостоятельно и непосредственное выполнение задания по обучению LoRA/QLoRA обычно намного дешевле в денежном выражении, чем оплата обучения управляемого провайдера за каждый токен. При настройках этого калькулятора по умолчанию (50 000 примеров, 512 токенов/пример, 2 эпохи) управляемое задание LoRA на Together AI (0,48 доллара США за 1 миллион обучающих токенов) стоит около $24,58, в то время как те же 51,2 миллиона обучающих токенов на арендованном A100 80 ГБ по цене $1,89/час и пропускная способность 15 000 токенов/сек стоят примерно 1,79 доллара — более чем на 90% меньше. Но этот разрыв представляет собой простое сравнение стоимости вычислений, а не полную совокупную стоимость владения: он не включает в себя ваше время на настройку конвейера обучения, обработку контрольных точек или отладку сбоев, ни одно из которых управляемый API не заставляет вас делать. Будет ли аренда графического процессора на самом деле дешевле для вас, зависит от того, насколько вы цените время установки, поэтому в этом калькуляторе есть дополнительное поле для часов установки, которое вы можете поднять выше нуля, чтобы увидеть изменение изображения.
Какой графический процессор мне нужен для тонкой настройки LoRA?
Для большинства заданий LoRA/QLoRA на моделях с параметрами примерно до 13B-34B одного графического процессора емкостью 80 ГБ — A100 80 ГБ или H100 80 ГБ — достаточно, поскольку LoRA обучает только небольшой набор добавленных весов адаптера низкого ранга, а не полную модель, а QLoRA квантует замороженные базовые веса до 4 бит для дальнейшего сжатия памяти, поэтому все задание умещается на одной карте вместо кластера с несколькими графическими процессорами. потребуется полная доработка. Большие базовые модели или более длинные контекстные окна увеличивают потребность в памяти и могут потребовать меньшего размера пакета, более агрессивного квантования или большего графического процессора, а фактическая пропускная способность обучения (токены в секунду) сильно зависит от количества параметров. Этот калькулятор по умолчанию использует значение 15 000 токенов в секунду в качестве примерной оценки, но вам следует настроить его на число, основанное на размере вашей модели и графическом процессоре, прежде чем доверять выходным данным в долларах.
Почему существует такой большой разрыв в стоимости между управляемым и самодельным проектом?
Управляемые API-интерфейсы обучения LoRA, такие как Together AI и Fireworks, выставляют счета не только за необработанные секунды графического процессора — ставка за токен включает в себя надежность инфраструктуры, оркестрацию заданий, автоматическое создание контрольных точек, организацию очередей и повторных попыток, а также группу поддержки, к которой вы можете обратиться, если обучение завершится неудачей на полпути, и ничего из этого вы не получите, арендовав голый экземпляр графического процессора самостоятельно. Этот пакет имеет реальную надбавку к базовой стоимости вычислений, и поскольку арендованный A100 или H100 с почасовой оплатой не имеет такой наценки, выходящей за рамки собственной маржи облачного провайдера, разрыв между ними может выглядеть огромным, если сравнивать только строку стоимости вычислений. Честное предостережение заключается в том, что DIY не является бесплатным в том смысле, в котором это выглядит в сравнении — кто-то должен писать и отлаживать сценарий обучения, управлять контрольными точками и обрабатывать сбои без необходимости звонить в службу поддержки, что происходит в режиме реального времени, даже если это никогда не отображается в виде оплаты за каждый токен.
В чем разница между LoRA и полной стоимостью доводки?
Полная точная настройка обновляет каждый параметр в модели, поэтому наш калькулятор полной тонкой настройки моделирует стоимость обучения как токены набора данных, умноженные на эпохи, умноженные на скорость обучения поставщика поверх базовой модели, которую вы полностью изменяете — и обычно ему требуется достаточно памяти графического процессора (или бюджета управляемого обучения) для хранения градиентов и состояния оптимизатора для всего количества параметров, что дорого при любом реальном размере модели. Вместо этого LoRA и QLoRA замораживают базовую модель и обучают небольшое количество добавленных весов адаптеров низкого ранга, поэтому объем вычислений и памяти — и, следовательно, стоимость как со стороны управляемого API, так и со стороны аренды графического процессора — представляет собой небольшую часть полной тонкой настройки для сопоставимого набора данных. Вот почему в этом калькуляторе и калькуляторе полной тонкой настройки используются разные формы затрат: стоимость полной тонкой настройки оценивается в первую очередь в зависимости от тарифов на обучение поставщика, поскольку полная тонкая настройка своими руками редко бывает практичной для одного арендованного графического процессора, в то время как LoRA/QLoRA дешевы и достаточно малы, поэтому аренда одного графического процессора самостоятельно становится реалистичной, часто гораздо более дешевой альтернативой управляемому API.