Как работает этот калькулятор
The Калькулятор стоимости выводов AI для конфиденциальных вычислений (TEE) начинается с твоего ежемесячные запросы × среднее количество токенов за запрос получить общее количество токенов за месяц — по умолчанию 1 000 000 × 500 — это 500 000 000 токенов. Разделив это на 1 000 000 и умножив на стандартная (неконфиденциальная) стоимость за 1 миллион токенов дает стандартная ежемесячная стоимость — 1000,00 долларов США по умолчанию 2,00 доллара США/1 миллион долларов США. Режим «Конфиденциальный/TEE» не добавляет к этому плоской разметки — он снижает эффективную пропускную способность, поскольку графический процессор тратит циклы на шифрование памяти, криптографическую аттестацию и работает с ограниченным доступом к аппаратным счетчикам производительности, используемым для оптимизации. Этот калькулятор моделирует это как конфиденциальныйComputeCost = StandardMonthlyCost ÷ (1 − % накладных расходов ÷ 100), что математически то же самое, что сказать, что графический процессор выполняет ту же работу за меньшее полезное время — при значении по умолчанию 12% $1000 ÷ 0,88 = $1136,36.
Помимо стоимости вычислений, некоторые провайдеры взимают небольшую плату. плата за услугу аттестации за запрос для покрытия криптографического подтверждения, которое доказывает, что рабочая нагрузка действительно выполняется внутри проверенного TEE перед отправкой конфиденциальных данных — при значении по умолчанию 0,0001 доллара США/запрос × 1 000 000 запросов, это составляет 100 долларов США в месяц. Сложение стоимости вычислений и стоимости аттестации дает общая стоимость конфиденциальных вычислений ($1236,36 по умолчанию), и вычитание стандартной стоимости дает премия в долларах (236,36 долларов США) и процентах (23,6%) — эквивалентно, эффективная стоимость за 1 миллион токенов возрастает со стандартных 2,00 долларов США до конфиденциальных примерно 2,47 долларов США. процент накладных расходов Это входные данные, за которыми следует внимательно следить: реализации TEE существенно улучшились: по отраслевым отчетам эффективность выросла с примерно 70–75 % (25–30 % накладных расходов) в конфиденциальных вычислениях H100 эпохи 2024 года и ранних стеках TDX/SEV-SNP до примерно 85–92 % эффективности (8–15 % накладных расходов) на аппаратном обеспечении H100/H200 текущего поколения и более зрелых стеках драйверов — используйте таблицу чувствительности ниже, чтобы увидеть, насколько это важно. Одно предположение меняет ваш ежемесячный счет.
Часто задаваемые вопросы
Что такое конфиденциальные вычисления для вывода ИИ?
Конфиденциальные вычисления для вывода ИИ запускают вашу модель и ваши данные в аппаратно-изолированной доверенной среде выполнения (TEE), так что содержимое памяти — подсказки, веса модели, активации — остается зашифрованным даже от собственной операционной системы, гипервизора и администраторов облачного провайдера. NVIDIA реализует это как режим конфиденциальных вычислений на графических процессорах H100 и H200, в котором память графического процессора шифруется, а криптографическая аттестация доказывает клиенту, что рабочая нагрузка действительно выполняется внутри подлинного, немодифицированного TEE, прежде чем будут отправлены какие-либо конфиденциальные данные. Со стороны ЦП Intel TDX (расширения домена доверия) и AMD SEV-SNP (безопасная зашифрованная виртуализация) обеспечивают эквивалентную изоляцию хост-машины, координирующей работу графического процессора. Практический эффект заключается в том, что больница, банк или государственное учреждение может отправлять записи пациентов или финансовые данные для вывода, работающего на общем парке графических процессоров стороннего облака, с аппаратной гарантией того, что сам поставщик не сможет прочитать данные в виде открытого текста или извлечь весовые коэффициенты проприетарных моделей, поэтому развертывания в регулируемых отраслях все чаще требуют его в качестве флажка наряду со стандартными элементами управления, такими как шифрование при передаче и регистрация доступа.
Сколько стоит TEE/конфиденциальный вывод?
При настройках по умолчанию этого калькулятора — стандартная стоимость 2,00 доллара США за 1 миллион токенов, накладные расходы на производительность 12 %, плата за аттестацию каждого запроса — 0,0001 доллара США, 1 000 000 ежемесячных запросов, в среднем по 500 токенов каждый — стоимость вывода в конфиденциальном режиме составляет около 1 236,36 долларов США в месяц по сравнению со стандартными 1 000,00 долларов США в месяц, надбавка составляет примерно 236,36 долларов США или 23,6%, в результате чего эффективная стоимость выросла с 2,00 долларов США до примерно 2,47 долларов США за 1 миллион токенов. Большая часть этого разрыва — это накладные расходы на вычислительную пропускную способность (графический процессор выполняет одну и ту же работу по шифрованию и аттестации независимо от размера запроса, поэтому он обрабатывает меньше токенов в секунду в конфиденциальном режиме), а не фиксированную плату за аттестацию, которая сравнительно невелика, если объем запросов не очень велик с небольшой полезной нагрузкой. Процент накладных расходов — это входные данные, на которые следует обратить внимание: они существенно различаются в зависимости от поколения графического процессора и поставщика, поэтому эту долларовую надбавку следует рассматривать как иллюстративную, пока вы не подтвердите фактические накладные расходы, которые обеспечивает ваш конкретный поставщик и комбинация оборудования.
Одинаковы ли накладные расходы для каждого графического процессора?
Нет. Накладные расходы на конфиденциальные вычисления зависят от поколения графического процессора, конкретной рабочей нагрузки (размера пакета, длины последовательности, архитектуры модели) и того, как поставщик реализует аттестацию и управление ключами вокруг нее. Более ранние ускорители с поддержкой TEE и программные стеки первого поколения для конфиденциального режима сообщали об эффективности примерно в диапазоне 70–75 % по сравнению с неконфиденциальным режимом, что означает 25–30 % накладных расходов, поскольку ранние пути шифрования памяти и аттестации добавляли значительные затраты на сериализацию и полосу пропускания. Новые реализации конфиденциальных вычислений H100/H200 и более зрелые стеки драйверов и встроенного ПО увеличили эффективность примерно до 85–92 %, то есть накладные расходы приближаются к 8–15 %, поскольку поставщики оптимизировали механизмы шифрования и сократили количество проверок аттестации, которые находятся на горячем пути. Меньшие размеры пакетов и более короткие последовательности, как правило, приводят к пропорционально более высоким накладным расходам, поскольку фиксированные затраты на аттестацию и шифрование каждого запроса амортизируются за счет меньшего количества фактических вычислений, в то время как большие пакетные рабочие нагрузки с длинным контекстом уменьшают эти фиксированные затраты и показывают накладные расходы ближе к нижней границе диапазона.
Когда стоит платить премию TEE?
Надбавку за TEE стоит платить всякий раз, когда нормативная база, договорное соглашение об обработке данных или политика внутренних рисков требуют аппаратного подтверждения того, что третья сторона не может получить доступ к открытым текстовым данным или весам модели во время вывода. Наиболее яркими примерами являются рабочие нагрузки в сфере здравоохранения, касающиеся PHI, финансовых услуг, обрабатывающих данные счетов или транзакций, правительственные и оборонные развертывания, а также любого поставщика искусственного интеллекта B2B, чьи корпоративные клиенты требуют этого в анкете безопасности. Гораздо труднее оправдать использование внутреннего инструментария, прототипирования, общедоступных или уже анонимизированных данных или любой рабочей нагрузки, в которой подписанное соглашение об обработке данных и стандартные средства управления шифрованием при хранении и передаче уже удовлетворяют ваши обязательства по соблюдению требований, поскольку увеличение затрат на 10–25 % быстро увеличивается в масштабе и не приносит никакой пользы, если никто на самом деле не требует аттестации оборудования. Решение обычно вообще не является вопросом оптимизации затрат — речь идет о том, требует ли TEE конкретное требование соответствия или договор с клиентом, и в этом случае надбавка — это просто цена за разрешение обслуживать эту рабочую нагрузку, и этот калькулятор существует для определения этой цены, а не для того, чтобы отговаривать вас от ее оплаты.