Cada capa escanea cada solicitud de forma independiente. A diferencia de los precios de LLM basados ​​en tokens, la mayoría de las API de guardarraíl cobran por elemento verificado, por lo que la factura aumenta con el volumen de solicitudes, no con el costo del modelo subyacente. Es por eso que una pila de capas pagas puede terminar costando más que el gasto en tokens de un modelo rápido y barato.

pila de barandillas / mes
por solicitud
impuesto de seguridad (% del gasto en LLM)
capas activas

Costo por nivel, mismo volumen

Mismo volumen de solicitudes y selección de capas, tres niveles de tarifas.

NivelCosto de barandilla / mesImpuesto de seguridad
⚠️ Calcule utilizando tarifas de referencia representativas (julio de 2026), no precios de proveedores en vivo: las hojas de tarifas varían según el proveedor, el tipo de artículo (texto, imagen o video) y los descuentos por volumen. El nivel de prototipo asume modelos gratuitos/autohospedados (punto final de moderación OpenAI, Llama Guard en su propia computadora) con un costo marginal cercano a $0. Confirme los precios actuales con el proveedor elegido antes de comprometerse. · Informar precio desactualizado →

Por qué "agregar una llamada de moderación" subestima el costo real

La mayor parte de la planificación de costos para una función LLM comienza y termina con el precio simbólico del propio modelo. Un sistema de producción que habla con usuarios reales casi nunca se envía con solo esa llamada: agrega moderación de entrada para detectar mensajes incorrectos antes de que lleguen al modelo, moderación de salida para detectar terminaciones incorrectas antes de que lleguen al usuario y, cada vez más, redacción de PII y detección de inyección rápida a medida que los agentes adquieren capacidades de procesamiento de documentos y llamadas de herramientas. Cada una de ellas es una llamada API separada, con un precio por artículo en lugar de por token, y cada una se ejecuta en cada solicitud, independientemente de cuán corta o barata sea la llamada al modelo subyacente. En un gran volumen con un modelo rápido y económico, la pila de barandillas puede convertirse en la partida más grande de la factura, no en el LLM.

El marco del "impuesto a la seguridad"

Expresar el costo de la barandilla como porcentaje del gasto en LLM (el impuesto de seguridad) hace que la compensación sea legible de una manera que una cifra en dólares no lo hace. Un equipo que ejecuta gastos de clase GPT-4o puede absorber unos cientos de dólares de moderación sin darse cuenta; la misma factura de protección junto a un caso de uso de un modelo económico y de gran volumen (por ejemplo, clasificación de atención al cliente en un modelo pequeño y rápido) puede eclipsar el costo del modelo varias veces. Esa no es una razón para omitir las barreras de seguridad; es una razón para dimensionar la pila según la superficie de riesgo real en lugar de ejecutar cada capa en cada solicitud de forma predeterminada.

¿Dónde están los verdaderos ahorros?

Dos palancas importan más que elegir un proveedor más barato: filtrar previamente con heurísticas gratuitas (listas de palabras clave/regex, búsquedas de hash incorrectos conocidos) para que solo el contenido ambiguo llegue a la API paga, y ser honesto acerca de qué capas su producto realmente necesita; consulte las preguntas frecuentes anteriores. El autohospedaje de un modelo de barrera abierta como Llama Guard 3 o Granite Guardian elimina por completo la tarifa por artículo a cambio de poseer una infraestructura de inferencia, que suele ser la mejor opción una vez que el volumen es alto y estable. Para conocer el precio de la capa de moderación por sí solo, consulte la calculadora de costos de moderación de contenido; para gastos de evaluación/equipo rojo en lugar de filtrado de producción, consulte la Calculadora de costos de evaluación de LLM.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
Costo de moderación de contenidoCosto de evaluación de LLMCalculadora de costos del agente de IACalculadora de costos de pila de API