Cada camada verifica cada solicitação de forma independente. Ao contrário dos preços LLM baseados em tokens, a maioria das APIs de proteção cobram por item verificado – portanto, a conta é dimensionada de acordo com o volume de solicitações, não com o custo da própria chamada de modelo subjacente. É por isso que uma pilha de camadas pagas pode acabar custando mais do que o gasto de token do próprio modelo barato e rápido.
—
pilha de guarda-corpos / mês
—por solicitação
—imposto de segurança (% dos gastos com LLM)
—camadas ativas
Custo por nível, mesmo volume
Mesmo volume de solicitações e seleção de camadas, três níveis de taxas.
| Nível | Custo do guarda-corpo / mês | Imposto de segurança |
|---|
⚠️ Estime usando taxas de referência representativas (julho de 2026), e não preços de fornecedores em tempo real — as tabelas de preços variam de acordo com fornecedor, tipo de item (texto x imagem x vídeo) e descontos por volume. A camada de protótipo pressupõe modelos gratuitos/auto-hospedados (endpoint de moderação OpenAI, Llama Guard em sua própria computação) a um custo marginal próximo de US$ 0. Confirme o preço atual com o provedor escolhido antes de se comprometer. ·
Informar preço desatualizado →
Por que “adicionar uma chamada de moderação” é inferior ao custo real
A maior parte do planejamento de custos para um recurso LLM começa e termina no preço simbólico do próprio modelo. Um sistema de produção que se comunica com usuários reais quase nunca é fornecido com apenas uma chamada — ele adiciona moderação de entrada para capturar prompts incorretos antes que eles cheguem ao modelo, moderação de saída para detectar conclusões incorretas antes que cheguem ao usuário e cada vez mais redação de PII e detecção de injeção de prompt à medida que os agentes ganham habilidades de chamada de ferramentas e processamento de documentos. Cada uma delas é uma chamada de API separada, com preço por item e não por token, e cada uma delas é executada em cada solicitação, independentemente de quão curta ou barata foi a chamada do modelo subjacente. Em alto volume com um modelo rápido e barato, a pilha de guarda-corpo pode se tornar o item de linha maior na fatura – e não o LLM.
O enquadramento do “imposto de segurança”
Expressar o custo do guardrail como uma porcentagem dos gastos do LLM – o imposto de segurança – torna a compensação legível de uma forma que um valor bruto em dólares não o faz. Uma equipe que executa gastos da classe GPT-4o pode absorver algumas centenas de dólares de moderação sem perceber; a mesma conta de proteção ao lado de um caso de uso de modelo barato e de alto volume (triagem de suporte ao cliente em um modelo pequeno e rápido, por exemplo) pode diminuir o custo do modelo várias vezes. Isso não é motivo para ignorar as proteções — é um motivo para dimensionar a pilha de acordo com a superfície de risco real, em vez de executar todas as camadas em todas as solicitações por padrão.
Onde estão as poupanças reais
Duas alavancas são mais importantes do que escolher um fornecedor mais barato: pré-filtragem com heurísticas gratuitas (listas de palavras-chave/regex, pesquisas de hash conhecidas como ruins) para que apenas conteúdo ambíguo chegue à API paga e ser honesto sobre quais camadas seu produto realmente precisa - consulte o FAQ acima. A auto-hospedagem de um modelo de guardrail aberto como Llama Guard 3 ou Granite Guardian remove inteiramente a taxa por item em troca da propriedade de infraestrutura de inferência, que geralmente é a melhor negociação quando o volume é alto e estável. Para a camada de moderação com preço individual, consulte o calculadora de custos de moderação de conteúdo; para gastos de avaliação/red-team em vez de filtragem de produção, consulte o Calculadora de custo de avaliação LLM.
Custo de moderação de conteúdoCusto de avaliação LLMCalculadora de custos do agente AICalculadora de custo de pilha de APIGuardrails: auto-hospedados x gerenciadosCusto de verificação KYC e ID
Como funciona esta calculadora
O Calculadora de custos de pilha AI Guardrails estima o verdadeiro custo mensal de execução de uma camada de segurança LLM de produção - moderação de entrada, moderação de saída, redação de PII e detecção de injeção imediata — como um pacote combinado em vez de quatro itens de linha separados. Multiplica seu solicitações por mês pelo custo por cheque implícito na sua seleção nível de taxa, então expressa o total em relação ao seu gasto atual de LLM para mostrar o imposto de segurança: a porcentagem do orçamento do modelo que as proteções adicionam. Os principais motivadores são o volume de solicitações, quantos dos quatro cheques você empilha e o nível para o qual você se qualifica, uma vez que um volume maior geralmente altera o preço unitário.
A principal compensação a observar é cobertura versus despesas gerais. A triagem de entrada e saída praticamente dobra as chamadas de proteção, e cada verificação adiciona latência e também custo, de modo que uma pilha pode rivalizar silenciosamente com o gasto do modelo que protege. Use a calculadora para testar se cada camada merece seu lugar — algumas cargas de trabalho justificam moderação completa mais redação de PII, enquanto o tráfego interno de menor risco pode ser executado com segurança somente entrada verificações. Execute-o novamente sempre que o volume de solicitações ultrapassar um limite de nível, porque a porcentagem do imposto de segurança pode mudar drasticamente mesmo quando o uso do modelo subjacente permanece estável.
Perguntas frequentes
Por que uma pilha de segurança custaria mais do que a própria chamada LLM?
Porque cada camada de proteção verifica o mesmo texto de forma independente e tem preço por item, não por token – e uma configuração de produção geralmente executa várias camadas (moderação de entrada, moderação de saída, redação de PII, detecção de injeção imediata) em cada solicitação. Em um alto volume de solicitações com um modelo subjacente barato, as taxas de proteção por solicitação podem somar mais do que o custo do token por solicitação do próprio modelo pequeno/rápido, especialmente quando você passa de níveis gratuitos como o endpoint de moderação da OpenAI e entra em plataformas pagas de terceiros.
Preciso de todas as quatro camadas de guarda-corpo?
Não – depende do que você está construindo. Uma ferramenta interna simples com usuários confiáveis e autenticados muitas vezes pode ignorar totalmente a detecção de injeção de prompt e a redação de PII e confiar apenas na moderação de entrada + saída. Um agente voltado para o cliente que pode realizar ações (chamadas de ferramentas, compras, alterações de conta) ou que processa documentos enviados pelo usuário é onde a detecção de injeção e o tratamento de PII deixam de ser opcionais. Desative cada camada abaixo para ver quanto você está realmente pagando por aquelas de que não precisa.
Os modelos de guardrail auto-hospedados são mais baratos que uma API?
Muitas vezes sim, em escala – modelos abertos como Llama Guard 3 ou IBM Granite Guardian podem ser executados em sua própria GPU ou em um endpoint de inferência compartilhado apenas por um custo próximo ao de computação, sem taxa por item. A desvantagem é a mesma de auto-hospedar qualquer modelo: você possui tempo de atividade, ajuste de latência e mantém o modelo atualizado contra novos padrões de ataque, em vez de uma API gerenciada que custa por item, mas cuida dessa manutenção para você.