Cada capa escanea cada solicitud de forma independiente. A diferencia de los precios de LLM basados en tokens, la mayoría de las API de guardarraíl cobran por elemento verificado, por lo que la factura aumenta con el volumen de solicitudes, no con el costo del modelo subyacente. Es por eso que una pila de capas pagas puede terminar costando más que el gasto en tokens de un modelo rápido y barato.
—
pila de barandillas / mes
—por solicitud
—impuesto de seguridad (% del gasto en LLM)
—capas activas
Costo por nivel, mismo volumen
Mismo volumen de solicitudes y selección de capas, tres niveles de tarifas.
| Nivel | Costo de barandilla / mes | Impuesto de seguridad |
|---|
⚠️ Calcule utilizando tarifas de referencia representativas (julio de 2026), no precios de proveedores en vivo: las hojas de tarifas varían según el proveedor, el tipo de artículo (texto, imagen o video) y los descuentos por volumen. El nivel de prototipo asume modelos gratuitos/autohospedados (punto final de moderación OpenAI, Llama Guard en su propia computadora) con un costo marginal cercano a $0. Confirme los precios actuales con el proveedor elegido antes de comprometerse. ·
Informar precio desactualizado →
Por qué "agregar una llamada de moderación" subestima el costo real
La mayor parte de la planificación de costos para una función LLM comienza y termina con el precio simbólico del propio modelo. Un sistema de producción que habla con usuarios reales casi nunca se envía con solo esa llamada: agrega moderación de entrada para detectar mensajes incorrectos antes de que lleguen al modelo, moderación de salida para detectar terminaciones incorrectas antes de que lleguen al usuario y, cada vez más, redacción de PII y detección de inyección rápida a medida que los agentes adquieren capacidades de procesamiento de documentos y llamadas de herramientas. Cada una de ellas es una llamada API separada, con un precio por artículo en lugar de por token, y cada una se ejecuta en cada solicitud, independientemente de cuán corta o barata sea la llamada al modelo subyacente. En un gran volumen con un modelo rápido y económico, la pila de barandillas puede convertirse en la partida más grande de la factura, no en el LLM.
El marco del "impuesto a la seguridad"
Expresar el costo de la barandilla como porcentaje del gasto en LLM (el impuesto de seguridad) hace que la compensación sea legible de una manera que una cifra en dólares no lo hace. Un equipo que ejecuta gastos de clase GPT-4o puede absorber unos cientos de dólares de moderación sin darse cuenta; la misma factura de protección junto a un caso de uso de un modelo económico y de gran volumen (por ejemplo, clasificación de atención al cliente en un modelo pequeño y rápido) puede eclipsar el costo del modelo varias veces. Esa no es una razón para omitir las barreras de seguridad; es una razón para dimensionar la pila según la superficie de riesgo real en lugar de ejecutar cada capa en cada solicitud de forma predeterminada.
¿Dónde están los verdaderos ahorros?
Dos palancas importan más que elegir un proveedor más barato: filtrar previamente con heurísticas gratuitas (listas de palabras clave/regex, búsquedas de hash incorrectos conocidos) para que solo el contenido ambiguo llegue a la API paga, y ser honesto acerca de qué capas su producto realmente necesita; consulte las preguntas frecuentes anteriores. El autohospedaje de un modelo de barrera abierta como Llama Guard 3 o Granite Guardian elimina por completo la tarifa por artículo a cambio de poseer una infraestructura de inferencia, que suele ser la mejor opción una vez que el volumen es alto y estable. Para conocer el precio de la capa de moderación por sí solo, consulte la calculadora de costos de moderación de contenido; para gastos de evaluación/equipo rojo en lugar de filtrado de producción, consulte la Calculadora de costos de evaluación de LLM.
Costo de moderación de contenidoCosto de evaluación de LLMCalculadora de costos del agente de IACalculadora de costos de pila de APIGuardrails: autohospedado frente a administradoCosto de verificación de identidad y KYC
Cómo funciona esta calculadora
El Calculadora de costos de pila de barandillas de IA estima el costo mensual real de ejecutar una capa de seguridad LLM de producción: moderación de entrada, moderación de salida, redacción de PII y detección de inyección rápida — como un paquete combinado en lugar de cuatro líneas de pedido separadas. multiplica tu solicitudes por mes por el costo por cheque implícito en su seleccionado nivel de tarifa, luego expresa el total contra tu gasto actual en LLM para mostrar el impuesto de seguridad: el porcentaje del presupuesto de su modelo que las barandillas agregan a la parte superior. Los principales factores son el volumen de solicitudes, cuántos de los cuatro cheques acumula y el nivel para el que califica, ya que un mayor volumen generalmente cambia el precio unitario.
La contrapartida clave a tener en cuenta es cobertura versus gastos generales. La detección tanto de la entrada como de la salida duplica aproximadamente las llamadas de guardarraíl, y cada verificación agrega latencia y costo, por lo que una pila puede rivalizar silenciosamente con el gasto del modelo que protege. Utilice la calculadora para comprobar si cada capa ocupa su lugar: algunas cargas de trabajo justifican una moderación total más la redacción de PII, mientras que el tráfico interno de menor riesgo puede ejecutarse de forma segura. solo entrada cheques. Vuelva a ejecutarlo cada vez que el volumen de solicitudes cruce un límite de nivel, porque el porcentaje del impuesto de seguridad puede variar bruscamente incluso cuando el uso del modelo subyacente se mantiene estable.
Preguntas frecuentes
¿Por qué una pila de seguridad costaría más que la propia convocatoria de LLM?
Porque cada capa de barrera escanea el mismo texto de forma independiente y tiene un precio por artículo, no por token, y una configuración de producción a menudo ejecuta varias capas (moderación de entrada, moderación de salida, redacción de PII, detección de inyección rápida) en cada solicitud. En un volumen de solicitudes alto con un modelo subyacente económico, las tarifas de protección por solicitud pueden sumar más que el costo del token por solicitud de un modelo pequeño/rápido, especialmente una vez que haya superado los niveles gratuitos como el punto final de moderación de OpenAI y haya ingresado a plataformas pagas de terceros.
¿Necesito las cuatro capas de barandillas?
No, depende de lo que estés construyendo. Una herramienta interna simple con usuarios autenticados y confiables a menudo puede omitir por completo la detección de inyección rápida y la redacción de PII y confiar únicamente en la moderación de entrada y salida. Un agente de atención al cliente que puede tomar acciones (llamadas de herramientas, compras, cambios de cuenta) o que procesa documentos enviados por los usuarios es donde la detección de inyecciones y el manejo de PII dejan de ser opcionales. Desactive cada capa a continuación para ver cuánto está pagando realmente por las que no necesita.
¿Son los modelos de barandilla autohospedados más baratos que una API?
A menudo sí, a escala: modelos abiertos como Llama Guard 3 o IBM Granite Guardian pueden ejecutarse en su propia GPU o en un punto final de inferencia compartido por un costo cercano al de cómputo únicamente, sin tarifa por artículo. La compensación es la misma que la del autohospedaje de cualquier modelo: usted es dueño del tiempo de actividad, del ajuste de la latencia y de mantener el modelo actualizado frente a nuevos patrones de ataque, frente a una API administrada que tiene un precio por elemento pero que se encarga del mantenimiento por usted.