0 modelos comparados · haga clic en el encabezado de una columna para ordenar
| Modelo ▲▼ | Proveedor ▲▼ | Aporte $/1M ▲▼ | Producción $/1M ▲▼ | Mezclado 3:1 ▲▼ | Contexto ▲▼ | Su $/mes ▲▼ |
|---|
Por qué una comparación justa de precios de IA necesita dos números
Casi todas las tablas de "precios de modelos de IA" que encontrará en línea están ordenadas por precio de entrada, porque es el número más pequeño y fácil de imprimir. Pero las aplicaciones reales se facturan ambos direcciones, y los tokens de salida tienen habitualmente un precio de dos a seis veces más alto que el de entrada. Una aplicación de recuperación o resumen que lee documentos extensos y escribe respuestas breves requiere muchas entradas; un chatbot, agente o generador de código que produce finalizaciones largas genera muchos resultados. Los mismos dos modelos pueden intercambiar lugares en el ranking basándose únicamente en la dirección en la que se inclina su tráfico. Es por eso que esta tabla muestra la entrada y la salida por separado, agrega un línea de base combinada 3:1 (una proporción común en el mundo real de tres tokens de entrada por token de salida) para una clasificación rápida de manzanas por manzanas y le permite ingresar sus propios volúmenes para calcular la factura que realmente pagaría.
Cómo leer la tabla
Escriba en el cuadro de búsqueda para ir a un modelo o proveedor, o haga clic en los chips de proveedor y categoría para limitar el campo: insignia, medio, presupuesto, razonamiento, integración, visión o peso abierto. Haga clic en cualquier encabezado de columna para ordenar de forma ascendente, haga clic nuevamente para invertir. El Tu $/mes La columna se recalcula instantáneamente a partir de los volúmenes de entrada y salida en la parte superior, para que pueda dimensionar una carga de trabajo real en cada modelo a la vez. El contexto se muestra en miles de tokens (K): una ventana de contexto de 1000 K significa un millón de tokens.
La calidad fronteriza se está volviendo barata
La brecha entre los modelos premium y económicos se ha reducido drásticamente. En 2026, se podrá ejecutar un modelo de peso abierto de primera línea (Llama 4, Qwen 3, DeepSeek V4) por una fracción de lo que cuestan GPT-5.5 o Claude Opus, y para muchas tareas de producción (clasificación, extracción, chat de rutina) la diferencia de calidad es invisible para los usuarios finales. Los revendedores alojados como Together, Fireworks, DeepInfra, Groq y Novita compiten con los mismos pesos, por lo que el mismo modelo puede aparecer varias veces a precios ligeramente diferentes. La decisión correcta rara vez es "utilizar el mejor modelo en todas partes", sino ruta por dificultad, dejando que un modelo barato se encargue de la mayor parte, mientras que un modelo de frontera se reserva para la minoría dura de las llamadas.
Tres palancas por debajo del precio del modelo.
Una vez que haya elegido un modelo, tres mecanismos reducen aún más la factura. Almacenamiento en caché rápido factura las indicaciones repetidas del sistema y el contexto a una fracción de la velocidad de entrada normal; dimensione en el calculadora de ahorro de almacenamiento en caché rápida. API por lotes Ofrezca aproximadamente un 50% de descuento en trabajos que pueden esperar; consulte el calculadora de ahorro de API por lotes. Y enrutar las llamadas de rutina a un modelo más pequeño suele ser la palanca más importante de todas: modelarlo según el Calculadora de costos de enrutador modelo AI.
Herramientas y guías relacionadas
El buscador de API LLM más barato · Calculadora de costos de tokens LLM · Precios de OpenAI, Claude y Gemini · Calculadora de precios de LLM combinado · Calculadora de costos de enrutador modelo AI · Todas las API de IA