Publicado el 2 de agosto de 2026 · precios de referencia de nuestro registro de 387 modelos, verificar antes de presupuestar
"Utilice simplemente el modelo pequeño" es el consejo de costes estándar. Finalmente le puse el precio adecuado a todo nuestro registro de modelos y el consejo resulta casi inútil por sí solo. Bajar un nivel dentro de la alineación de Anthropic te salva 40%. El mismo movimiento exacto dentro de la línea de ahorros de Google 96%. La misma decisión, la misma cantidad de trabajo de ingeniería, resultados tremendamente diferentes, porque la brecha entre el producto estrella de un proveedor y su nivel económico no es una constante. Va desde 1,7× hasta 24×.
Un mes, 200 millones de tokens de entrada y 40 millones de tokens de salida. Eso equivale aproximadamente a 250.000 solicitudes con 800 tokens de entrada y 160 de salida: un producto con forma real que realiza clasificación, resúmenes y respuestas breves al chat. Sin almacenamiento en caché ni descuentos por lotes, por lo que las cifras siguen siendo comparables. Todos los precios a continuación provienen de nuestro registro rastreado (387 modelos, precios de referencia de julio a agosto de 2026).
| Familia | Nivel | $/1 millón en | $/1 millón de salida | Mes |
|---|---|---|---|---|
| AbiertoAI | GPT-5.5 | $5.00 | $30.00 | $2,200 |
| GPT-5 | $1.25 | $10.00 | $650 | |
| GPT-5 mini | $0.40 | $1.60 | $144 | |
| GPT-5 nano mas barato | $0.10 | $0.40 | $36 | |
| antrópico | Claude Opus 4.8 | $5.00 | $25.00 | $2,000 |
| Soneto de Claudio 4.6 | $3.00 | $15.00 | $1,200 | |
| Claude Haiku 4.5 | $1.00 | $5.00 | $400 | |
| Géminis 3.1 Pro | $2.00 | $12.00 | $880 | |
| Géminis 3.1 Flash | $0.10 | $0.40 | $36 | |
| Géminis 3.1 Flash-Lite | $0.05 | $0.20 | $18 | |
| xAI | Grok 4 | $3.00 | $15.00 | $1,200 |
| Grok 4 mini | $0.50 | $2.50 | $200 | |
| búsqueda profunda | Búsqueda profunda V4 | $0.27 | $1.10 | $98 |
| Flash DeepSeek V4 | $0.14 | $0.28 | $39 | |
| Mistral | Mistral grande | $2.00 | $6.00 | $640 |
| Mistral Pequeño | $0.10 | $0.30 | $32 |
Elimina todo excepto el movimiento que la mayoría de los equipos realmente consideran: el buque insignia al nivel inmediatamente inferior:
| Mover | Antes → después | Guardado |
|---|---|---|
| Opus 4.8 → Soneto 4.6 | $2000 → $1200 | 40% |
| DeepSeek V4 → V4 Flash | $98 → $39 | 60% |
| GPT-5.5 → GPT-5 | $2200 → $650 | 70% |
| Grok 4 → Grok 4 mini | $1200 → $200 | 83% |
| Mistral Grande → Pequeño | $640 → $32 | 95% |
| Géminis 3.1 Pro → Flash | $880 → $36 | 96% |
Cuarenta por ciento versus noventa y seis por ciento. Ambos son "usar el modelo más pequeño". Uno de ellos merece un sprint de trabajo de evaluación y una capa de enrutamiento; el otro vale, en el mejor de los casos, una tarde, porque pasará más horas de ingeniero demostrando que Sonnet es lo suficientemente bueno que los $800 que se ahorra.
Esto no es que Anthropic sea tacaño con los descuentos. Es todo lo contrario: su buque insignia se volvió dramáticamente más barato. Claude Opus 4.1 se encuentra en nuestro registro en $15/$75. Opus 4.5, 4.6 y 4.8 todos se sientan en $5/$25 – un recorte de 3× en la parte superior de la alineación sin cambios en el precio de Sonnet o Haiku. En mi mes de 240 millones de tokens, Opus pasó de $ 6,000 a $ 2,000.
El efecto secundario: la brecha entre el Opus y el Soneto se redujo de 5× a 1,67×. El impuesto fronterizo en Anthropic prácticamente dejó de existir. OpenAI hizo lo mismo en un eje diferente: o1 a $ 15/$ 60 fue reemplazado por GPT-5 a $ 1,25/$ 10, por lo que la línea de pedido del modelo de frontera costosa que la gente presupuestaba para 2025 es ahora de un orden de magnitud diferente.
Google fue por el otro lado. Mantuvieron Pro a un precio razonable de $2/$12 y bajaron Flash-Lite a $0,05/$0,20, por lo que su diferencial interno es ahora el más amplio de cualquier familia importante. Nada de eso es accidental: es un tono de ruta.
Costos de Flash Géminis 3.1 $36 en esta carga de trabajo. DeepSeek V4, que había archivado mentalmente como "la opción barata", cuesta $98 – casi 3 veces más. Y GPT-5.5 a $2200 es 122 veces el precio de Gemini 3.1 Flash-Lite a $18 por mover el mismo volumen de tokens.
Llevaba encima una clasificación mental de precios de hacía dos años. Estaba mal en ambas direcciones. La reputación de los vendedores baratos va por detrás de las hojas de precios reales en aproximadamente un año, y las cifras se mueven más rápido que el folclore.
1. Compruebo la brecha de niveles antes de construir el enrutador. Si de buque insignia a mini es inferior a 2×, una cascada no vale la complejidad ni el presupuesto de evaluación: tomo el buque insignia y dedico el esfuerzo al almacenamiento en caché rápido, lo que reduce más.
2. Si la diferencia es de 20×, hago ruta agresivamente. El nivel económico se encarga de la clasificación, extracción, etiquetado y enrutamiento. El buque insignia sólo ve lo que no pasa un control de confianza. En el diferencial de Google que convierte 880 dólares en algo cercano a 60 dólares con una tasa de aumento del 10%, la aritmética está en el Calculadora de ahorros en cascada de LLM y el calculadora de ahorro de enrutamiento modelo.
3. Vuelvo a fijar el precio de toda la gama cada trimestre. La revisión de precios de Opus cambió qué optimizaciones valía la pena hacer y lo descubrí con semanas de retraso. Eso es lo que rastreador de cambios de precio es por ahora.
4. Nunca comparo únicamente el precio de los insumos. La salida ejecuta 4× entrada en la mediana en los 97 modelos de chat propios que verifiqué, y 6× en GPT-5.5 y Gemini 3.1 Pro. Un modelo hablador con una tarifa de insumo barata pierde frente a uno conciso con una tarifa cara con más frecuencia de lo que la gente espera. Si su aplicación cambia de modelo, el costo de la migración también importa; consulte la calculadora de costos de migración de modelos.
Pon tu propio token dividido en el Calculadora de costos de API de IA →, o modelar un producto completo en el Estimador de costos de aplicaciones de IA y el calculadora de costos de chatbot. ¿Nuevo en el precio de los tokens? Empezar en Más información: cómo funcionan los precios de API.
Estimaciones de referencia, agosto de 2026, tomadas de nuestro registro de modelos rastreados. Los precios cambian sin previo aviso y excluyen los descuentos por almacenamiento en caché, por lotes y por volumen; verifique con el proveedor antes de comprometer un presupuesto. No afiliado a OpenAI, Anthropic, Google, xAI, DeepSeek o Mistral.