Consejo: un producto de chat normalmente ejecuta entre 3 y 6 veces más tokens de entrada que de salida (el historial se reenvía en cada turno). Si solo conoce el total de tokens, divídalos 80/20.

0 los modelos encajan · ordenados por nivel de calidad, luego espacio libre ·

ModeloProveedorCosto mensual% del presupuestoEspacio libreNivel

Los precios son estimaciones de referencia (). Informar precio desactualizado →

Cómo utilizar la columna de altura libre

El margen de maniobra es cuántas veces podría crecer su volumen actual antes de que el modelo supere el presupuesto. Un modelo con un 45 % del presupuesto tiene ~2,2 veces el margen de maniobra; al 90%, sólo 1,1 veces: el primer mes de crecimiento lo supera. El uso de LLM casi siempre crece más rápido de lo planeado (conversaciones más largas, reintentos, nuevas funciones agregadas silenciosamente), por lo tanto, considere 2× headroom como el mínimo práctico para una selección de producción.

El juego inteligente suele ser un par: un caballo de batalla económico dentro del presupuesto con un margen de maniobra de 5×+ para el 80% de las consultas fáciles, además de un buque insignia que se usa con moderación para el 20% difícil. El calculadora de enrutamiento de modelos muestra las matemáticas combinadas, y el tabla comparativa completa le permite inspeccionar cualquier modelo que aparezca en la superficie de este buscador. Los precios aquí caen ~10 ×/año a capacidad constante; consulte la rastreador de historial de precios — vuelva a realizar esta verificación trimestralmente; el conjunto de modelos que se ajustan a tu presupuesto crece por sí solo.