HomeTools › Costo de la cadena de respaldo del modelo de IA
costo mensual combinado
gastos generales versus primario puro
% de gastos generales
mezclado $ / solicitud

¿Cuánto cuesta cada tasa alternativa?

Los mismos tokens, el mismo tráfico: solo cambia la tasa de activación primaria → alternativa.

Tasa de retrocesoCosto mensualGastos generales versus primarios% de gastos generales
⚠️Estimación. Se supone que las llamadas con velocidad limitada o fallidas no las factura el nivel que las rechazó; solo se factura el nivel que completa la solicitud. Los precios predeterminados son cifras de referencia (julio 2026) — confirme los precios actuales de tokens por millón en el panel de control de cada proveedor. · Informar precio desactualizado →

El costo oculto de su nivel de confiabilidad

Una cadena de respaldo de modelo es el patrón de puerta de enlace de IA estándar de 2026: enviar la solicitud a un modelo primario rápido y económico; Si esa llamada tiene una velocidad limitada o hay errores, la puerta de enlace (OpenRouter, Portkey, LiteLLM o un contenedor personalizado) vuelve a intentar automáticamente con un modelo alternativo más caro y confiable y, a veces, con un tercer nivel si el sistema alternativo también falla. Es la arquitectura adecuada para el tiempo de actividad, pero el nivel alternativo suele tener un precio de entre 5 y 20 veces el principal por token, precisamente porque el principal se eligió por ser barato. Una tasa de retorno que parece insignificante en un tablero (5%, incluso 2%) puede mover la factura mucho más de lo que sugiere ese porcentaje.

La matemática no es lineal porque los dos niveles no tienen el mismo precio. Costo combinado por solicitud = costo_primario × (1 − p1) + costo_alternativo × p1 × (1 − p2) + costo_terciario × p1 × p2, donde p1 es la tasa de activación de primario a alternativo y p2 es la (mucho más rara) tasa de retroceso a terciario. Con una diferencia de precios de 14 veces entre los niveles, una tasa de reserva del 5% puede agregar entre un 50% y un 65% a la factura combinada, aunque el 95% de las solicitudes aún lleguen al primario barato, porque ese 5% del tráfico está pagando más de la mitad del costo total en dólares.

Esta es una forma de costo genuinamente diferente a la enrutamiento modelo deliberado (donde eliges la división barato/caro por diseño) o una sencilla reintento en caso de error costo (donde el mismo modelo se reintenta). En este caso, el objetivo de la escalada es un modelo diferente, más caro, y se desencadena por las condiciones de la infraestructura (capacidad, límites de tarifas), no por la dificultad de la tarea.

Relacionado: ahorros en el enrutamiento del modelo, Costo de reintento de API, Costo de migración de proveedores de LLM, presupuesto de bucle de agente.

como usarlo

1. Elija una cadena preestablecida o ingrese sus propios precios por millón para los niveles primario, alternativo y terciario.
2. Ingrese las solicitudes mensuales y los tokens de entrada/salida típicos por solicitud.
3. Establezca sus tasas de activación primarias→de reserva y de reserva→terciarias observadas (o estimadas).
4. Lea el costo mensual combinado y los gastos generales versus una base de referencia puramente primaria; use la tabla para ver qué tan sensible es su factura a la tasa alternativa.

Errores comunes

Suponiendo que el costo de reserva aumenta con la tasa de reserva. No es así: aumenta con la tasa de reserva multiplicada por la relación de precios entre niveles, que suele ser mucho mayor. Ignorando el nivel terciario. Si su respaldo también falla bajo una carga sostenida, el nivel terciario (si lo hay) generalmente cuesta lo mismo que el respaldo, pero agrega riesgo de latencia; modelelo incluso a una tasa baja. Facturación de llamadas fallidas. La mayoría de los proveedores no cobran por el rechazo de un límite de tarifa estricto; si el suyo lo hace (generación parcial antes de un error a mitad de camino), su sobrecarga real es mayor que esta estimación. Persiguiendo el 100% de tiempo de actividad con el respaldo más costoso. Una alternativa de nivel medio a menudo recupera la mayor parte de la confiabilidad a una fracción del costo de saltar directamente al modelo insignia.

Preguntas frecuentes

¿Qué es una cadena de respaldo del modelo de IA?

Un patrón de puerta de enlace en el que una solicitud fallida o con velocidad limitada se reintenta automáticamente con un modelo de respaldo y, opcionalmente, un tercer nivel si este también falla. Utilizado por OpenRouter, Portkey, LiteLLM y herramientas similares.

¿Por qué cuesta tanto una pequeña tasa alternativa?

Los modelos alternativos suelen tener un precio muy superior al principal por token. Incluso una tasa de activación del 5% puede agregar más del 50% a la factura si el costo alternativo cuesta entre 10 y 14 veces más por solicitud.

¿Se facturan las solicitudes rechazadas?

Práctica estándar: un rechazo estricto del límite de tasa 429 factura $0, ya que no se generaron tokens. Esta calculadora asume esa convención.

¿Cómo puedo reducir la tasa de reserva de forma económica?

Aumente el límite de velocidad de su nivel principal, agregue retroceso y reintento en el principal antes de escalar, distribuya el tráfico entre claves/proveedores o inserte un respaldo de nivel medio en lugar de saltar directamente al modelo más caro.

Estimación únicamente. Los precios de los modelos son cifras de referencia y cambian con frecuencia; verifique los precios actuales con cada proveedor.