Cada capa escanea cada solicitud de forma independiente. A diferencia de los precios de LLM basados en tokens, la mayoría de las API de guardarraíl cobran por elemento verificado, por lo que la factura aumenta con el volumen de solicitudes, no con el costo del modelo subyacente. Es por eso que una pila de capas pagas puede terminar costando más que el gasto en tokens de un modelo rápido y barato.
Costo por nivel, mismo volumen
Mismo volumen de solicitudes y selección de capas, tres niveles de tarifas.
| Nivel | Costo de barandilla / mes | Impuesto de seguridad |
|---|
Por qué "agregar una llamada de moderación" subestima el costo real
La mayor parte de la planificación de costos para una función LLM comienza y termina con el precio simbólico del propio modelo. Un sistema de producción que habla con usuarios reales casi nunca se envía con solo esa llamada: agrega moderación de entrada para detectar mensajes incorrectos antes de que lleguen al modelo, moderación de salida para detectar terminaciones incorrectas antes de que lleguen al usuario y, cada vez más, redacción de PII y detección de inyección rápida a medida que los agentes adquieren capacidades de procesamiento de documentos y llamadas de herramientas. Cada una de ellas es una llamada API separada, con un precio por artículo en lugar de por token, y cada una se ejecuta en cada solicitud, independientemente de cuán corta o barata sea la llamada al modelo subyacente. En un gran volumen con un modelo rápido y económico, la pila de barandillas puede convertirse en la partida más grande de la factura, no en el LLM.
El marco del "impuesto a la seguridad"
Expresar el costo de la barandilla como porcentaje del gasto en LLM (el impuesto de seguridad) hace que la compensación sea legible de una manera que una cifra en dólares no lo hace. Un equipo que ejecuta gastos de clase GPT-4o puede absorber unos cientos de dólares de moderación sin darse cuenta; la misma factura de protección junto a un caso de uso de un modelo económico y de gran volumen (por ejemplo, clasificación de atención al cliente en un modelo pequeño y rápido) puede eclipsar el costo del modelo varias veces. Esa no es una razón para omitir las barreras de seguridad; es una razón para dimensionar la pila según la superficie de riesgo real en lugar de ejecutar cada capa en cada solicitud de forma predeterminada.
¿Dónde están los verdaderos ahorros?
Dos palancas importan más que elegir un proveedor más barato: filtrar previamente con heurísticas gratuitas (listas de palabras clave/regex, búsquedas de hash incorrectos conocidos) para que solo el contenido ambiguo llegue a la API paga, y ser honesto acerca de qué capas su producto realmente necesita; consulte las preguntas frecuentes anteriores. El autohospedaje de un modelo de barrera abierta como Llama Guard 3 o Granite Guardian elimina por completo la tarifa por artículo a cambio de poseer una infraestructura de inferencia, que suele ser la mejor opción una vez que el volumen es alto y estable. Para conocer el precio de la capa de moderación por sí solo, consulte la calculadora de costos de moderación de contenido; para gastos de evaluación/equipo rojo en lugar de filtrado de producción, consulte la Calculadora de costos de evaluación de LLM.