Каждый уровень сканирует каждый запрос независимо. В отличие от ценообразования LLM на основе токенов, большинство API-интерфейсов Guardrail взимают плату за проверенный элемент, поэтому счет масштабируется в зависимости от объема запроса, а не от стоимости самого вызова базовой модели. Вот почему набор платных слоев может в конечном итоге стоить дороже, чем затраты на собственные токены дешевой и быстрой модели.
—
стопка ограждений / месяц
—по запросу
—налог на безопасность (% расходов на LLM)
—слои активны
Стоимость по уровням, тот же объем
Тот же объем запросов и выбор слоев, три уровня тарифов.
| Уровень | Стоимость ограждения / мес. | Налог на безопасность |
|---|
⚠️ Оценивайте, используя репрезентативные справочные цены (июль 2026 г.), а не текущие цены поставщиков — прейскуранты различаются в зависимости от поставщика, типа товара (текст, изображение или видео) и оптовых скидок. Уровень прототипа предполагает бесплатные/автономные модели (конечная точка модерации OpenAI, Llama Guard на вашем собственном компьютере) с предельными затратами около 0 долларов США. Прежде чем совершать сделку, подтвердите текущие цены у выбранного вами поставщика. ·
Сообщить об устаревшей цене →
Почему «добавление модерационного звонка» занижает реальную стоимость
Большая часть планирования затрат на функцию LLM начинается и заканчивается на собственной цене токена модели. Производственная система, которая общается с реальными пользователями, почти никогда не поставляется только с одним вызовом — она добавляет модерацию входных данных для выявления неверных подсказок до того, как они достигнут модели, модерацию выходных данных для выявления неверных завершений до того, как они достигнут пользователя, а также все большее редактирование PII и обнаружение внедрения подсказок по мере того, как агенты приобретают навыки вызова инструментов и обработки документов. Каждый из них представляет собой отдельный вызов API, цена которого рассчитывается за элемент, а не за токен, и каждый из них выполняется при каждом отдельном запросе, независимо от того, насколько коротким или дешевым был вызов базовой модели. При больших объемах продаж с использованием быстрой и дешевой модели стопка ограждений может стать более крупной статьей в счете, а не LLM.
Схема «налога на безопасность»
Выражение стоимости ограждения в процентах от расходов на LLM (налог на безопасность) делает компромисс понятным, чего не делает чистая цифра в долларах. Команда, проводящая расходы класса GPT-4o, может незаметно поглотить несколько сотен долларов модерации; тот же счет за ограждение рядом с крупномасштабным вариантом использования дешевой модели (например, сортировка поддержки клиентов на небольшой быстрой модели) может в несколько раз затмить стоимость модели. Это не повод пропускать ограждения — это повод подобрать размер стека в соответствии с фактической поверхностью риска вместо того, чтобы по умолчанию запускать каждый уровень при каждом запросе.
Где реальная экономия
Два рычага имеют большее значение, чем выбор более дешевого поставщика: предварительная фильтрация с помощью бесплатной эвристики (списки ключевых слов/регулярных выражений, поиск по известным плохим хэшам), чтобы только неоднозначный контент попадал в платный API, и честность в отношении того, какие уровни действительно нужны вашему продукту — см. часто задаваемые вопросы выше. Самостоятельное размещение открытой модели ограждения, такой как Llama Guard 3 или Granite Guardian, полностью устраняет плату за каждый предмет в обмен на владение инфраструктурой вывода, что обычно является лучшей сделкой, если объем высок и стабилен. Уровень модерации, стоимость которого указана отдельно, см. Калькулятор стоимости модерации контента; о расходах на оценку/красную команду вместо фильтрации производства см. Калькулятор оценки LLM.
Стоимость модерации контентаСтоимость оценки LLMКалькулятор стоимости AI-агентаКалькулятор стоимости стека APIОграждения: самостоятельное размещение и управляемоеСтоимость проверки KYC и удостоверения личности
Как работает этот калькулятор
The Калькулятор стоимости стека AI Guardrails оценивает истинную ежемесячную стоимость эксплуатации производственного уровня безопасности LLM — модерация входных данных, модерация выходных данных, редактирование личных данных и обнаружение быстрого внедрения — как объединенный пакет, а не четыре отдельных позиции. Это умножает ваш запросов в месяц по стоимости проверки, подразумеваемой выбранным вами уровень тарифа, затем выражает сумму против вашего текущие расходы на LLM показать налог на безопасность: процент бюджета вашей модели, который добавляют ограждения сверху. Основными факторами являются объем запроса, количество чеков, которые вы складываете, и уровень, на который вы имеете право, поскольку более высокий объем обычно меняет цену за единицу.
Ключевым компромиссом, на который стоит обратить внимание, является покрытие по сравнению с накладными расходами. Проверка как ввода, так и вывода примерно удваивает количество вызовов Guardrail, а каждая проверка увеличивает задержку и стоимость, поэтому стек может спокойно конкурировать с затратами модели, которые он защищает. Используйте калькулятор, чтобы проверить, заслуживает ли каждый уровень свое место — некоторые рабочие нагрузки оправдывают полную модерацию плюс редактирование личных данных, в то время как внутренний трафик с низким уровнем риска может безопасно работать. только для ввода чеки. Повторно запускайте его всякий раз, когда объем запросов пересекает границу уровня, поскольку процент налога на безопасность может резко измениться, даже если использование базовой модели остается неизменным.
Часто задаваемые вопросы
Почему стек безопасности будет стоить дороже, чем сам вызов LLM?
Потому что каждый уровень защиты сканирует один и тот же текст независимо и оценивается за единицу, а не за токен, а производственная установка часто запускает несколько уровней (модерация ввода, модерация вывода, редактирование PII, обнаружение быстрого внедрения) для каждого отдельного запроса. При большом объеме запросов с дешевой базовой моделью плата за ограждение за каждый запрос может превышать стоимость токена за запрос небольшой/быстрой модели, особенно после того, как вы преодолеете бесплатные уровни, такие как конечная точка модерации OpenAI, и перейдете на платные сторонние платформы.
Нужны ли мне все четыре слоя ограждения?
Нет, это зависит от того, что вы строите. Простой внутренний инструмент с доверенными, аутентифицированными пользователями часто может полностью пропустить обнаружение быстрого внедрения и редактирование PII и полагаться только на модерацию ввода + вывода. Агент, работающий с клиентами, который может выполнять действия (вызовы инструментов, покупки, изменения в учетных записях) или обрабатывать отправленные пользователем документы, — это тот случай, когда обнаружение внедрения и обработка PII перестают быть необязательными. Отключите каждый слой ниже, чтобы увидеть, сколько вы на самом деле платите за те, которые вам не нужны.
Дешевле ли автономные модели ограждений, чем API?
Часто да, в масштабе — открытые модели, такие как Llama Guard 3 или IBM Granite Guardian, могут работать на вашем собственном графическом процессоре или общей конечной точке вывода только по затратам, близким к вычислительным, без платы за каждый элемент. Компромисс тот же, что и при самостоятельном размещении любой модели: вы сами владеете временем безотказной работы, настройкой задержки и поддержанием актуальности модели против новых шаблонов атак, а не управляемым API, цена которого указана за каждый элемент, но который выполняет обслуживание за вас.