Как работает ценообразование LLM API

Токены, ввод и вывод, контекстные окна — почему одна и та же задача может стоить в 50 раз дороже для одной модели, чем для другой, объясняется просто.

Дом › Учиться › Пакетный API: скидка 50 % на несрочные задания

Пакетный API: скидка 50 % на несрочные задания

Большинство людей звонят модели ИИ и ждут ответа в режиме реального времени. Но большая часть работы ИИ вообще не является срочной: создание отчетов в одночасье, массовая классификация, маркировка наборов данных. Для этих задач пакетные API предлагают те же модели с огромной скидкой, обычно около 50 %, в обмен на отказ от мгновенных результатов.

Что такое пакетный API

Пакетный API позволяет отправлять множество запросов одновременно как одно задание, а не по одному в режиме реального времени. Вы загружаете файл, содержащий все ваши запросы, провайдер обрабатывает их асинхронно в течение определенного периода времени, а вы загружаете результаты, когда они готовы.

Сделка, которую вы совершаете, проста: вы отказываетесь от скорости и получаете более низкую цену. Вместо ответа в течение нескольких секунд вы можете подождать несколько минут или часов. В свою очередь, стоимость токена обычно снижается примерно вдвое по сравнению со стандартной синхронной скоростью.

Почему поставщики могут предлагать скидки

Трафик API в реальном времени является резким и непредсказуемым. Провайдеры должны поддерживать резервные мощности на случай пиков спроса, а этот запас мощности в режиме простоя обходится дорого. Пакетные задания являются гибкими: их можно запускать при наличии свободных мощностей, сглаживая нагрузку.

Поскольку вы позволяете поставщику планировать вашу работу в более спокойные периоды, он может более эффективно использовать оборудование и возвращать вам часть этой экономии. Скидка — это не некачественная модель, это та же самая модель, работающая по спокойному графику.

Как выглядит рабочий процесс

Типичный пакетный процесс состоит из четырех этапов:

  • Подготовьте файл где каждая строка представляет собой один запрос, обычно в структурированном формате с настраиваемым идентификатором, чтобы вы могли сопоставить результаты с входными данными.
  • Отправить партию и получите идентификатор вакансии.
  • Опрос для определения статуса пока поставщик работает в очереди, часто с установленным сроком завершения, например, в течение 24 часов.
  • Получить выходной файл после завершения сопоставьте каждый результат обратно с его запросом, используя идентификаторы.

Логика вашего приложения практически не меняется, используются те же подсказки и те же модели. Что меняется, так это то, что вы не блокируете каждый ответ.

Какие вакансии подходят для пакетной модели

Пакетная обработка идеальна, когда человек не ждет ответа:

  • Массовая классификация или маркировка больших наборов данных.
  • Генерация контента для каталогов, описаний продуктов или обзоров, подготовленных заранее.
  • Извлечение данных из больших коллекций документов.
  • Оценки и бэктестирование где вы запускаете подсказку для тысяч тестовых случаев.
  • Вложения генерация для всего корпуса одновременно.

Он плохо подходит для чего-либо интерактивного: чат-ботов, живого поиска или любой функции, где пользователь смотрит на индикатор загрузки.

Экономика ожидания

Об экономии легко рассуждать. Если работа будет стоить 200 долларов по стандартной ставке, а скидка на партию составляет 50%, вместо этого она будет стоить 100 долларов при одинаковом выпуске. При больших повторяющихся рабочих нагрузках эта разница увеличивается с каждым месяцем.

Вот проработанный пример с иллюстративными показателями, чтобы математика оставалась конкретной. Классификация 1 миллиона коротких документов по 500 входным и 20 выходным токенам в каждом составляет 500 миллионов входных токенов и 20 миллионов выходных токенов. При примерной ставке 0,15 доллара США за 1 миллион входных токенов и 0,60 доллара США за 1 миллион выходных токенов синхронная цена составит около 75 долларов США + 12 долларов США = 87 долларов США за всю работу. То же самое задание через пакетную конечную точку за полцены снижает эту сумму примерно до 43,50 долларов США — экономия в 43,50 доллара США за один запуск, еще до того, как вы даже посчитаете запуск в следующем месяце. Калькулятор стоимости LLM позволяет вам ввести количество и объем собственных токенов, а затем разделить их вдвое, чтобы просмотреть пакетный сценарий по сравнению с сценарием в реальном времени с использованием текущих ставок поставщика.

На что стоит обратить внимание

Несколько практических предостережений. Время завершения — это цель, а не гарантия, поэтому создайте свой конвейер так, чтобы он допускал переменные задержки. На очень большие пакеты могут распространяться ограничения по размеру или скорости, поэтому вам может потребоваться разделить огромные задания на части. И вы по-прежнему платите как за входные, так и за выходные токены, скидка применяется к ставке, а не к количеству токенов, поэтому оперативность по-прежнему имеет значение.

За невыполненные запросы внутри пакета оплата обычно не взимается. Если одна строка во входном файле имеет неправильный формат или в одном запросе возникла ошибка, провайдеры обычно взимают плату только за фактически выполненные запросы, а не за те, которые не удалось выполнить. Это означает, что несколько плохих строк не испортят скидку на остальную часть задания, но это также означает, что ваш выходной файл необходимо проверить на соответствие вашим входным идентификаторам, чтобы увидеть, какие запросы вам нужно отправить повторно.

Наконец, проверьте особенности каждого поставщика на страницах /models, поскольку точная скидка, целевой показатель оборота и поддерживаемые функции (например, работает ли кэширование или инструменты внутри пакета) различаются у разных поставщиков.

Часто задаваемые вопросы

Является ли пакетный API более слабой моделью?

Нет. Вы получаете ту же модель и то же качество вывода, что и API реального времени. Разница лишь в том, что результаты приходят позже, поэтому цена ниже.

Сколько времени занимает пакетная работа?

Поставщики обычно указывают срок завершения, например, в течение 24 часов, и многие задания завершаются гораздо быстрее, когда есть свободные мощности. Это не мгновенно, поэтому используйте его только тогда, когда никто не ждет ответа.

Сколько обычно экономят пакетные API?

Скидка около 50% на стандартную ставку за токен является общей для крупных поставщиков и применяется как к входным, так и к выходным токенам. Всегда подтверждайте текущую скидку для вашего конкретного поставщика и модели.

Плачу ли я за запросы, которые не выполняются внутри пакета?

Вообще нет. Поставщики обычно выставляют счет только за запросы в пакете, который фактически завершился успешно, поэтому неверный запрос или случайная ошибка не будут стоить вам скидки на остальную часть работы. Вам все равно придется сверить выходной файл с отправленными вами идентификаторами, чтобы узнать, какие запросы не удалось выполнить, и отправить их повторно.

Только образовательный, а не финансовый совет.

Tools & Hosting

📈 TradingView🔒 NordVPN💳 RevolutDigitalOcean $200Hostinger