Каждый уровень сканирует каждый запрос независимо. В отличие от ценообразования LLM на основе токенов, большинство API-интерфейсов Guardrail взимают плату за проверенный элемент, поэтому счет масштабируется в зависимости от объема запроса, а не от стоимости самого вызова базовой модели. Вот почему набор платных слоев может в конечном итоге стоить дороже, чем затраты на собственные токены дешевой и быстрой модели.

стопка ограждений / месяц
по запросу
налог на безопасность (% расходов на LLM)
слои активны

Стоимость по уровням, тот же объем

Тот же объем запросов и выбор слоев, три уровня тарифов.

УровеньСтоимость ограждения / мес.Налог на безопасность
⚠️ Оценивайте, используя репрезентативные справочные цены (июль 2026 г.), а не текущие цены поставщиков — прейскуранты различаются в зависимости от поставщика, типа товара (текст, изображение или видео) и оптовых скидок. Уровень прототипа предполагает бесплатные/автономные модели (конечная точка модерации OpenAI, Llama Guard на вашем собственном компьютере) с предельными затратами около 0 долларов США. Прежде чем совершать сделку, подтвердите текущие цены у выбранного вами поставщика. · Сообщить об устаревшей цене →

Почему «добавление модерационного звонка» занижает реальную стоимость

Большая часть планирования затрат на функцию LLM начинается и заканчивается на собственной цене токена модели. Производственная система, которая общается с реальными пользователями, почти никогда не поставляется только с одним вызовом — она добавляет модерацию входных данных для выявления неверных подсказок до того, как они достигнут модели, модерацию выходных данных для выявления неверных завершений до того, как они достигнут пользователя, а также все большее редактирование PII и обнаружение внедрения подсказок по мере того, как агенты приобретают навыки вызова инструментов и обработки документов. Каждый из них представляет собой отдельный вызов API, цена которого рассчитывается за элемент, а не за токен, и каждый из них выполняется при каждом отдельном запросе, независимо от того, насколько коротким или дешевым был вызов базовой модели. При больших объемах продаж с использованием быстрой и дешевой модели стопка ограждений может стать более крупной статьей в счете, а не LLM.

Схема «налога на безопасность»

Выражение стоимости ограждения в процентах от расходов на LLM (налог на безопасность) делает компромисс понятным, чего не делает чистая цифра в долларах. Команда, проводящая расходы класса GPT-4o, может незаметно поглотить несколько сотен долларов модерации; тот же счет за ограждение рядом с крупномасштабным вариантом использования дешевой модели (например, сортировка поддержки клиентов на небольшой быстрой модели) может в несколько раз затмить стоимость модели. Это не повод пропускать ограждения — это повод подобрать размер стека в соответствии с фактической поверхностью риска вместо того, чтобы по умолчанию запускать каждый уровень при каждом запросе.

Где реальная экономия

Два рычага имеют большее значение, чем выбор более дешевого поставщика: предварительная фильтрация с помощью бесплатной эвристики (списки ключевых слов/регулярных выражений, поиск по известным плохим хэшам), чтобы только неоднозначный контент попадал в платный API, и честность в отношении того, какие уровни действительно нужны вашему продукту — см. часто задаваемые вопросы выше. Самостоятельное размещение открытой модели ограждения, такой как Llama Guard 3 или Granite Guardian, полностью устраняет плату за каждый предмет в обмен на владение инфраструктурой вывода, что обычно является лучшей сделкой, если объем высок и стабилен. Уровень модерации, стоимость которого указана отдельно, см. Калькулятор стоимости модерации контента; о расходах на оценку/красную команду вместо фильтрации производства см. Калькулятор оценки LLM.

Разместите свой проект:DigitalOcean — 200 долларов бесплатно ↗Хостингер VPS
Стоимость модерации контентаСтоимость оценки LLMКалькулятор стоимости AI-агентаКалькулятор стоимости стека API