Каждый уровень сканирует каждый запрос независимо. В отличие от ценообразования LLM на основе токенов, большинство API-интерфейсов Guardrail взимают плату за проверенный элемент, поэтому счет масштабируется в зависимости от объема запроса, а не от стоимости самого вызова базовой модели. Вот почему набор платных слоев может в конечном итоге стоить дороже, чем затраты на собственные токены дешевой и быстрой модели.
Стоимость по уровням, тот же объем
Тот же объем запросов и выбор слоев, три уровня тарифов.
| Уровень | Стоимость ограждения / мес. | Налог на безопасность |
|---|
Почему «добавление модерационного звонка» занижает реальную стоимость
Большая часть планирования затрат на функцию LLM начинается и заканчивается на собственной цене токена модели. Производственная система, которая общается с реальными пользователями, почти никогда не поставляется только с одним вызовом — она добавляет модерацию входных данных для выявления неверных подсказок до того, как они достигнут модели, модерацию выходных данных для выявления неверных завершений до того, как они достигнут пользователя, а также все большее редактирование PII и обнаружение внедрения подсказок по мере того, как агенты приобретают навыки вызова инструментов и обработки документов. Каждый из них представляет собой отдельный вызов API, цена которого рассчитывается за элемент, а не за токен, и каждый из них выполняется при каждом отдельном запросе, независимо от того, насколько коротким или дешевым был вызов базовой модели. При больших объемах продаж с использованием быстрой и дешевой модели стопка ограждений может стать более крупной статьей в счете, а не LLM.
Схема «налога на безопасность»
Выражение стоимости ограждения в процентах от расходов на LLM (налог на безопасность) делает компромисс понятным, чего не делает чистая цифра в долларах. Команда, проводящая расходы класса GPT-4o, может незаметно поглотить несколько сотен долларов модерации; тот же счет за ограждение рядом с крупномасштабным вариантом использования дешевой модели (например, сортировка поддержки клиентов на небольшой быстрой модели) может в несколько раз затмить стоимость модели. Это не повод пропускать ограждения — это повод подобрать размер стека в соответствии с фактической поверхностью риска вместо того, чтобы по умолчанию запускать каждый уровень при каждом запросе.
Где реальная экономия
Два рычага имеют большее значение, чем выбор более дешевого поставщика: предварительная фильтрация с помощью бесплатной эвристики (списки ключевых слов/регулярных выражений, поиск по известным плохим хэшам), чтобы только неоднозначный контент попадал в платный API, и честность в отношении того, какие уровни действительно нужны вашему продукту — см. часто задаваемые вопросы выше. Самостоятельное размещение открытой модели ограждения, такой как Llama Guard 3 или Granite Guardian, полностью устраняет плату за каждый предмет в обмен на владение инфраструктурой вывода, что обычно является лучшей сделкой, если объем высок и стабилен. Уровень модерации, стоимость которого указана отдельно, см. Калькулятор стоимости модерации контента; о расходах на оценку/красную команду вместо фильтрации производства см. Калькулятор оценки LLM.