Cada camada verifica cada solicitação de forma independente. Ao contrário dos preços LLM baseados em tokens, a maioria das APIs de proteção cobram por item verificado – portanto, a conta é dimensionada de acordo com o volume de solicitações, não com o custo da própria chamada de modelo subjacente. É por isso que uma pilha de camadas pagas pode acabar custando mais do que o gasto de token do próprio modelo barato e rápido.
Custo por nível, mesmo volume
Mesmo volume de solicitações e seleção de camadas, três níveis de taxas.
| Nível | Custo do guarda-corpo / mês | Imposto de segurança |
|---|
Por que “adicionar uma chamada de moderação” é inferior ao custo real
A maior parte do planejamento de custos para um recurso LLM começa e termina no preço simbólico do próprio modelo. Um sistema de produção que se comunica com usuários reais quase nunca é fornecido com apenas uma chamada — ele adiciona moderação de entrada para capturar prompts incorretos antes que eles cheguem ao modelo, moderação de saída para detectar conclusões incorretas antes que cheguem ao usuário e cada vez mais redação de PII e detecção de injeção de prompt à medida que os agentes ganham habilidades de chamada de ferramentas e processamento de documentos. Cada uma delas é uma chamada de API separada, com preço por item e não por token, e cada uma delas é executada em cada solicitação, independentemente de quão curta ou barata foi a chamada do modelo subjacente. Em alto volume com um modelo rápido e barato, a pilha de guarda-corpo pode se tornar o item de linha maior na fatura – e não o LLM.
O enquadramento do “imposto de segurança”
Expressar o custo do guardrail como uma porcentagem dos gastos do LLM – o imposto de segurança – torna a compensação legível de uma forma que um valor bruto em dólares não o faz. Uma equipe que executa gastos da classe GPT-4o pode absorver algumas centenas de dólares de moderação sem perceber; a mesma conta de proteção ao lado de um caso de uso de modelo barato e de alto volume (triagem de suporte ao cliente em um modelo pequeno e rápido, por exemplo) pode diminuir o custo do modelo várias vezes. Isso não é motivo para ignorar as proteções — é um motivo para dimensionar a pilha de acordo com a superfície de risco real, em vez de executar todas as camadas em todas as solicitações por padrão.
Onde estão as poupanças reais
Duas alavancas são mais importantes do que escolher um fornecedor mais barato: pré-filtragem com heurísticas gratuitas (listas de palavras-chave/regex, pesquisas de hash conhecidas como ruins) para que apenas conteúdo ambíguo chegue à API paga e ser honesto sobre quais camadas seu produto realmente precisa - consulte o FAQ acima. A auto-hospedagem de um modelo de guardrail aberto como Llama Guard 3 ou Granite Guardian remove inteiramente a taxa por item em troca da propriedade de infraestrutura de inferência, que geralmente é a melhor negociação quando o volume é alto e estável. Para a camada de moderação com preço individual, consulte o calculadora de custos de moderação de conteúdo; para gastos de avaliação/red-team em vez de filtragem de produção, consulte o Calculadora de custo de avaliação LLM.