HomeBlog › El impuesto al token de razonamiento

El impuesto al token de razonamiento: por qué o3 cuesta 4 × GPT-4.1 al mismo precio de etiqueta

Publicado el 30 de julio de 2026 · precios de referencia, verificar antes de presupuestar

Abra la hoja de precios y o3 y GPT-4.1 se ven idénticos: ambos $2,00 de entrada, $8,00 de salida por millón de tokens. Entonces realicé el mismo trabajo de extracción en ambos, esperando la misma factura. o3 regresó 4,3 veces más caro. Misma entrada, misma respuesta visible, misma tasa por token. La brecha es una línea de pedido que la mayoría de la gente nunca ve en la página de precios: tokens de razonamiento.

Los tokens de razonamiento se facturan y se facturan como resultado.

Los modelos de razonamiento (o1, o3, o4-mini de OpenAI y los modos de razonamiento de GPT-5) no saltan directamente a una respuesta. Primero generan una cadena de pensamiento privada y luego una breve respuesta visible. Nunca ves la cadena, pero pagas por cada muestra de ella, al mismo tiempo. producción tasa. En una tarea en la que el modelo devuelve 400 fichas visibles, puede quemar silenciosamente otras 2000 fichas de razonamiento detrás de escena. Su factura se calcula sobre 2400 tokens de salida, no sobre 400.

Ese es todo el truco. El precio de etiqueta es honesto; simplemente describe el precio de los tokens, y los modelos de razonamiento emiten muchos más tokens caros.

Los precios principales ($ por 1 millón de tokens)

ModeloAporteProducciónTipo
GPT-4.1$2.00$8.00Estándar
o3$2.00$8.00Razonamiento
o4-mini más económico$1.10$4.40Razonamiento
o1$15.00$60.00Razonamiento
GPT-5$1.25$10.00Híbrido
⚠️ Precios de referencia, julio 2026. Verificar siempre en la página del proveedor. Pruebe sus propios números en el calculadora de costos. · Informar precio desactualizado →

Las matemáticas concretas

Tome una carga de trabajo en forma real: 1.000 solicitudes/día, cada uno 800 tokens de entrada y 400 tokens de salida visibles. Ejecútelo durante un mes (30.000 solicitudes, 24 millones de tokens de entrada, 12 millones de tokens de salida visibles). Ahora agrega la parte oculta. En mis propias carreras de la serie O, surge una tarea moderadamente difícil. 1500 a 2500 fichas de razonamiento; Usaré 2000 aquí, lo que agrega 60 millones de tokens de salida facturados además de los 12 millones visibles.

ModeloTokens de razonamiento/requisitoCosto / mes
GPT-4.1 (sin razonamiento)0$144
o4-mini~2000$343
o3~2000$624

GPT-4.1 y o3 comparten una hoja de precios, pero o3 factura $624 vs $144 - porque 72 millones de tokens de salida (12 millones visibles + 60 millones de razonamiento) pasan por el medidor de $ 8 en lugar de 12 millones. o4-mini es el término medio sensato: más barato por token, aún pagando el impuesto de razonamiento, por lo que cuesta $ 343, más del doble de un modelo sin razonamiento que hace el mismo trabajo visible.

La palanca que nadie pone: razonamiento_effort

OpenAI expone un reasoning_effort parámetro (mínimo / bajo / medio / alto). Es el botón más grande de este proyecto de ley y la mayoría de los códigos lo dejan en el valor predeterminado. Baja o3 de ~2000 fichas de razonamiento a ~400 y el mismo mes pasa de $624 a $240. Mismo modelo, misma tarea, un parámetro: un recorte del 62%. Para cualquier cosa que no sea realmente un problema difícil de varios pasos, un esfuerzo bajo o mínimo generalmente pasa la evaluación y elimina silenciosamente la mayor parte del impuesto.

Lo que realmente hago ahora

1. No busques un modelo de razonamiento por reflejo. La extracción, clasificación, etiquetado, enrutamiento y resúmenes breves no necesitan una cadena de pensamiento. Un modelo estándar con el mismo precio de etiqueta cuesta una cuarta parte porque no emite fichas de razonamiento.

2. Si necesito razonamiento, establezco reasoning_effort explícitamente y comience poco a poco, aumentando solo cuando una evaluación demuestre que la calidad de la respuesta disminuye.

3. Leo el completion_tokens_details campo. La respuesta de la API se divide reasoning_tokens por separado: ahí es donde se filtra el dinero, y es invisible en un modelo mental por solicitud "devolvió 400 tokens".

4. Hago ruta. Tarea barata → modelo pequeño estándar. Tarea difícil → modelo de razonamiento con esfuerzo medido. Un enrutador simple se amortiza en días; ver los números en el Calculadora de ahorros en cascada de LLM.

¿Quieres el número exacto de tu combinación de tokens? Pon tu entrada, salida visible y una estimación simbólica de razonamiento realista en el Calculadora de costos de API de IA →, o comparar proveedores cara a cara en el calculadora de costos de chatbot. ¿Nuevo en el precio de los tokens? Empezar en Más información: cómo funcionan los precios de API.

Estimaciones de referencia, julio de 2026. Los recuentos de tokens de razonamiento dependen de la carga de trabajo y se obtienen de nuestras propias ejecuciones, no de cifras de proveedores: mida las suyas. No afiliado a OpenAI.