Цены на использование и облако
Возможности устройства и резервный вариант
—
ежемесячная экономия по сравнению с использованием чистого облака и гибридным подходом на устройстве—экономия %
—базовый уровень чистого облака в месяц
—гибрид всего/мес.
Разбивка затрат
| Позиция | Выводы / мес. | Стоимость / мес. |
| Базовый вариант чистого облака (100 % облако, без использования устройства) | — | — |
| — пользователи только облака (без возможности использования на устройстве) | — | — |
| — Облачный резерв от пользователей, поддерживающих устройства. | — | — |
| = Счет за гибридное облако | — | — |
| + Амортизированная стоимость установки на устройстве. | — | — |
| = Общая ежемесячная стоимость гибридного варианта | — | — |
Безубыточность единовременных затрат на установку
—
Как это связано с другими инструментами
Два калькулятора, уже представленные на этом сайте, оценивают схожее, но конструктивно разное решение. Калькулятор стоимости самостоятельного хостинга и API и Калькулятор LLM на собственном хостинге и API обе модели серверная часть Самостоятельный хостинг — аренда собственного графического процессора или облачного экземпляра и выполнение логических выводов там самостоятельно, по сравнению с оплатой провайдеру за токен или за вызов. Форма затрат в обоих случаях по-прежнему представляет собой сервер где-то с реальным счетом за хостинг, только тот, который вы контролируете, а не поставщика. Этот калькулятор вместо моделей клиентская сторона Вывод на устройстве, выполняемый непосредственно на аппаратном обеспечении телефона конечного пользователя — отсутствие необходимости арендовать сервер, фактически нулевая предельная стоимость вывода после поставки модели и совершенно другое узкое место: не часы работы графического процессора, а то, какая часть ваших пользователей владеет достаточно функциональными устройствами и как часто даже этим устройствам все равно приходится возвращаться в облако. Если вы выбираете между арендой графического процессора и оплатой облачного API, воспользуйтесь самостоятельными калькуляторами; если вы решаете, стоит ли размещать квантованную модель внутри вашего мобильного приложения, именно она соответствует этой форме стоимости.
Чтение чисел
По умолчанию — 100 000 активных пользователей в месяц, 50 выводов на пользователя в день, 0,001 доллара США за вывод в облаке, единовременная сборка на устройстве в размере 40 000 долларов США, 60 % пользователей на совместимых устройствах, 5 % коэффициент перехода к облаку для этих способных пользователей, амортизируемый в течение 12 месяцев — базовый план для чистого облака составляет 150 000 долларов США в месяц. Переход на гибридный подход снижает остаточный счет за облако до 64 500 долларов США в месяц (60 000 000 выводов от пользователей, использующих только облако, плюс 4 500 000 резервных выводов от опытных пользователей), добавляет примерно 3 333 доллара США в месяц к амортизированной стоимости установки и приводит к итоговой гибридной стоимости около 67 833 долларов США в месяц — экономия около 82 167 долларов США в месяц или примерно Скидка 55 % на базовую версию чистого облака. Стоимость установки в 40 000 долларов сама по себе окупается менее чем за полмесяца при таком объеме, поскольку ежемесячные расходы на облако, которые она отклоняет (около 85 500 долларов в месяц), почти сразу затмевают единовременную стоимость сборки. Эта математика быстро меняется в меньшем масштабе: запустите те же входные данные для 5000 пользователей вместо 100 000, и безубыточность увеличится примерно в 20 раз — примерно 9,4 месяца вместо менее половины месяца — потому что отклоненных выводов в месяц просто недостаточно, чтобы быстро окупить затраты на сборку. Подключите реальный MAU вашего приложения, а не желаемый, прежде чем выделять инженерный бюджет на сборку на устройстве.
Калькулятор стоимости самостоятельного хостинга и APIКалькулятор LLM на собственном хостинге и APIКалькулятор стоимости вывода графического процессораОценщик стоимости приложения AI
Как работает этот калькулятор
The Вывод AI на Edge/на устройстве и калькулятор облачного API сначала вычисляет базовый уровень чистого облака: выводы на пользователя в день × активных пользователей в месяц × 30, priced at your cloud-per-inference rate — this is what you'd pay with zero on-device model at all. Затем он разделяет вашу пользовательскую базу на процент возможности использования на устройстве на способных пользователей и пользователей, работающих только в облаке. Пользователи, использующие только облако, выставляют полный счет за облако за каждый из своих выводов, поскольку их устройства вообще не могут работать с локальной моделью. Пользователи, поддерживающие устройства, в основном выполняют логические выводы локально с фактически нулевыми предельными затратами. кроме для процент возврата к облаку их запросов — слишком сложные, с низким энергопотреблением, холодный старт до завершения загрузки локальной модели или локальный результат с низкой достоверностью — что по-прежнему оплачивается облачным API.
Этот калькулятор намеренно делает нет укажите денежную цифру в вычислительных ресурсах устройства, расходе заряда батареи или объеме хранилища — после поставки модели предельные затраты на локальный вывод будут считаться равными нулю. Это реалистичное упрощение для небольших, хорошо квантованных моделей, работающих на современных флагманских чипах, где дополнительные затраты на батарею и вычислительные затраты на вывод незначительны по сравнению со счетом за облачный API. Это занижает реальную стоимость очень больших моделей на устройствах или старых/младших устройств, где тепловое регулирование, разрядка батареи и давление хранения являются реальными (хотя их трудно оценить в долларах) затратами, которые стоит взвесить отдельно. Остаточные выводы только об облаках и резервных облаках суммируются в счет за гибридное облако, тогда единовременная стоимость установки на устройстве (инжиниринг, квантование, доставка) делится на выбранный вами период амортизации и добавляется сверху, чтобы получить гибридная общая ежемесячная стоимость. Сравнение этого показателя с базовым уровнем чистого облака дает ежемесячную экономию и процент экономии, при этом стоимость установки делится на ежемесячно расходы на облако, которые оно отклоняет (чистое облако минус счет за гибридное облако, без учета амортизации), дает безубыточность в месяцах — насколько быстро окупается единовременная сборка только за счет экономии на облаке.
Часто задаваемые вопросы
Почему вывод на устройстве имеет единовременную стоимость, а не стоимость каждого вывода, как в случае с облачными API?
Потому что самая дорогая часть вывода на устройстве — это его построение, а не запуск. Уменьшение модели до размера, подходящего для телефона, преобразование ее в формат Core ML или TensorFlow Lite/NNAPI, тестирование ее на разных уровнях устройств и отправка ее внутри двоичного файла приложения или в качестве загружаемого ресурса — это фиксированный инженерный проект с фиксированной ценой, оплачиваемый один раз, независимо от того, будет ли его использовать один пользователь или десять миллионов пользователей. Вместо этого облачный API взимает плату за каждый запрос, поскольку время графического процессора провайдера представляет собой реальные предельные затраты на каждый отдельный вызов. После того, как модель на устройстве квантована и отправлена, выполнение еще одного вывода на собственном телефоне пользователя не будет стоить владельцу приложения практически ничего, кроме небольшого расхода батареи и вычислительных ресурсов пользователя — ни сервера, ни счета за вызов — именно это превращает единовременную стоимость установки во что-то, что стоит амортизировать в течение нескольких месяцев, а не тратить на каждый звонок.
Что произойдет, если мой процент возможности использования устройства будет низким — перестанет ли когда-нибудь использование устройства того стоить?
Да, и этот калькулятор создан для того, чтобы точно показывать, где находится эта линия. По мере того, как процент поддержки устройств падает, большая часть вашей пользовательской базы возвращается в корзину только для облака, поэтому остаточный ежемесячный счет за облако возвращается к базовому уровню чистого облака, в то время как вы все еще платите за амортизацию затрат на установку поверх него — при некотором достаточно низком проценте возможностей гибридный подход может стоить больше, чем когда-либо стоило бы чистое облако, а не меньше. Другой рычаг, который не менее важен, — это общий объем выводов: те же затраты на установку, которые окупаются менее чем за месяц при 100 000 активных пользователей в месяц, могут занять много месяцев или фактически никогда не окупиться в течение срока службы продукта при нескольких тысячах пользователей, потому что из счета за облако просто не хватает выводов, чтобы окупить затраты на создание. Прежде чем выделять инженерный бюджет на сборку на устройстве, стоит указать фактическое значение MAU и наилучшую реальную оценку возможностей устройства, а не предполагать, что экономические показатели уменьшаются линейно.
Почему даже для пользователей, работающих на устройстве, по-прежнему взимается плата за облако?
Потому что на практике возможности устройства никогда не работают по принципу «все или ничего». Даже на телефоне, который полностью способен работать с локальной моделью, некоторая часть запросов все равно должна отправляться в облако: запрос слишком сложный или выходит слишком далеко за рамки локальной модели, чтобы сжатая версия на устройстве могла хорошо обрабатываться, ситуация с низким уровнем заряда батареи или температурным регулированием, когда ОС ограничивает вычисления на устройстве, окно холодного запуска до завершения загрузки ресурса локальной модели после установки или обновления или просто локальный вывод, который возвращается с низкой достоверностью и требует облачной модели для перепроверьте это. В этом калькуляторе моделируется процент возврата к облаку, применяемый только к запросам пользователей, поддерживающих устройства, в дополнение к полному счету за облако, который по-прежнему причитается пользователям, чьи устройства вообще не могут выполнять логический вывод на устройстве, поэтому остаточная облачная позиция в гибридном итоге никогда не равна нулю, даже при очень высоких показателях возможностей устройств.
Чем это отличается от самостоятельного калькулятора LLM и API, который уже есть на этом сайте?
И калькулятор Self-Host vs API, и Self-Hosted LLM vs API Calculator уже представлены на этом сайте, моделируя самостоятельный хостинг на стороне сервера: аренда собственного экземпляра графического процессора или облачного хранилища и выполнение выводов там самостоятельно, по сравнению с оплатой облачному провайдеру за токен или за вызов — в обоих случаях форма затрат по-прежнему представляет собой сервер где-то со счетом за хостинг, только ваш, а не поставщика. Этот калькулятор моделирует нечто структурно иное: вывод на стороне клиента на устройстве, выполняемый непосредственно на аппаратном обеспечении телефона конечного пользователя, где нет необходимости арендовать сервер, а предельные затраты на вывод фактически равны нулю после поставки модели. Что заменяет здесь счет за хостинг, так это единовременные затраты на разработку и квантование модели, амортизируемые в течение нескольких месяцев, а также верхний предел того, сколько расходов на облако вы можете фактически отклонить — установленный тем, какая часть ваших пользователей владеет достаточно функциональными устройствами и как часто даже этим устройствам все равно приходится возвращаться в облако.