Cómo funciona esta calculadora
El Calculadora de costos del enrutador modelo AI estimates the blended monthly cost of serving your API traffic across two models instead of one. You enter your llamadas por mes, el tokens de entrada y salida por llamada, el proporción del tráfico dirigido al modelo baratoy los precios de entrada y salida por millón de tokens tanto para el modelo barato como para el premium. Aplica las tarifas de cada modelo a su parte de las solicitudes, suma los cargos de los tokens de entrada y salida e informa una cifra mensual combinada junto con los ahorros en comparación con el envío de cada llamada al modelo premium. Los principales factores de costo son el volumen total de llamadas, los tokens por llamada, la división de enrutamiento y la diferencia de precios entre los dos modelos.
La contrapartida clave a tener en cuenta es calidad versus costo: dirigir más tráfico al modelo económico reduce la cifra combinada, pero solo algunas solicitudes son lo suficientemente simples como para responder bien sin el modelo premium. Porque Los tokens de salida suelen tener un precio más alto que los tokens de entrada., las respuestas detalladas pueden dominar el total incluso en una división favorable, así que pruebe el modelo barato en sus mensajes reales y confirme que sus respuestas se mantengan antes de aumentar su porcentaje de tráfico.
Preguntas frecuentes
¿Qué es el enrutamiento modelo?
Enviar cada solicitud al modelo más barato que pueda manejarla: modelo pequeño para llamadas fáciles, modelo de frontera para llamadas difíciles. Un clasificador o reglas deciden, y el costo combinado queda muy por debajo del premium.
¿Cuánto puede ahorrar el enrutamiento?
A menudo, entre un 50% y un 80%, ya que la mayor parte del tráfico real es rutinario. El ahorro depende de cuánto puede enviar de forma segura al modelo económico sin perjudicar la calidad.