Los tokens de pensamiento se facturan a la tasa de salida y se ocultan de la respuesta. Una llamada p50 (típica) y una llamada p99 (dura) en el mismo modelo ejecutan un código idéntico pero aparecen muy separadas en la factura. La brecha –no el promedio– es lo que arruina un presupuesto mensual.

impuesto de razonamiento (participación de pensamiento oculto)
costo / llamada (típico)
mensual (típico p50)
mensual (cola p99)

Estimación ingenua versus típica versus cola

La fila "ingenua" es lo que le dice una simple calculadora de tokens: ignora por completo el pensamiento oculto. La diferencia con la fila típica es la prima de pensamiento que realmente pagará; la brecha con la fila de cola es el riesgo presupuestario.

Guiónfichas de pensamientoCosto/llamadaCosto / mesvs ingenuo

Banda presupuestaria por severidad de cola

El ancho que puede variar su factura mensual dependiendo de qué tan pesada se vuelve la cola dura y rápida. Elija el múltiplo de cola que coincida con cuán variables son realmente sus indicaciones.

Cola múltiplefichas de pensamiento p99Costo/llamadaCosto / mes
⚠️ Modelo de referencia, julio de 2026. Los tokens de pensamiento (razonamiento) se facturan en cada proveedor producción tasa de token y no se devuelven en la respuesta. El recuento de pensamiento p50 y el múltiplo de cola son sus estimaciones: obtenga números reales del panel de uso de su proveedor, que informa los tokens de razonamiento por separado. Los precios mostrados son tarifas de referencia editables; confirme las tarifas en vivo en la página de precios del proveedor. · Informar precio desactualizado →

Por qué un número único de coste por llamada miente en los modelos de razonamiento

Un modelo sin razonamiento es casi determinista en cuanto al costo: envías N tokens de entrada, obtienes M tokens de salida, multiplicas por las tasas y listo. Los modelos de razonamiento rompen eso. Entre la pregunta y la respuesta, el modelo sigue una cadena privada de pensamiento: el fichas de pensamiento – y se le facturará cada uno de ellos según la tarifa de salida, aunque nunca aparezcan en la respuesta. Fundamentalmente, el recuento es dependiente de los datos: una clasificación sencilla puede costar unos cientos, una prueba retorcida de varios pasos o un giro de planificación de herramientas agente puede costar decenas de miles. Entonces, el verdadero costo por llamada no es un número, es una distribución, y citar sólo su mediana (p50) oculta la parte de la distribución que realmente arruina los presupuestos: la cola.

El diferencial p50/p99 y el impuesto al razonamiento

El costo por llamada es entrada × precio_entrada + (salida_visible + pensamiento) × precio_salida. Mantenga todo fijo excepto el pensamiento y todo girará en torno a esa única variable. En el recuento de pensamiento típico, obtienes el coste de p50; multiplique el pensamiento por un factor de cola para el caso difícil y obtendrá p99. Con un razonamiento profundo, los dos pueden estar separados entre 3 y 5 veces, lo que significa que el mismo volumen mensual puede facturarse en cualquier parte de esa banda, dependiendo únicamente de qué tan difíciles hayan sido las indicaciones del mes. El impuesto de razonamiento (la fracción de la factura que está pensando en lugar de la información que envió o la respuesta que recibió) se liquida habitualmente entre un 70% y un 80% en cargas de trabajo intensas. Estás pagando principalmente por el trabajo preliminar. Ver esa participación suele ser el momento en que los equipos añaden un límite de pensamiento.

Cómo encoger la banda

Tres palancas lo mueven. Limite el esfuerzo de razonamiento o las fichas de pensamiento máximo para que la cola no pueda escapar físicamente; esto cambia un poco la calidad de las respuestas en las preguntas más difíciles por un límite estricto en el costo. Ruta por dificultad: envíe a la mayoría fácil a un modelo barato sin razonamiento y reserve el modelo de razonamiento para indicaciones que realmente lo necesiten. Y controle el p99, no el promedio, porque una serie de indicaciones estrictas levanta la cola mucho antes de que mueva el promedio. Tenga en cuenta que almacenamiento en caché rápido corta el lado de entrada pero no el lado de pensamiento, por lo que en el tráfico de mucho razonamiento, el límite de pensamiento es la palanca que importa; combínelo con el calculadora de tokens de razonamiento plano para la estimación puntual y la calculadora de presupuesto de bucle de agente para el caso de varios pasos.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
Costo del token de razonamientoPresupuesto del bucle del agenteCosto del token LLMComparar precios de modelos de IA

Intercambios

BybitbinanceOKXKuCoinbitgetpuerta.ioMEXC

Herramientas y alojamiento

📈 Vista comercial🔒 NordVPN💳 RevoluciónHostinger

Cómo funciona esta calculadora

Cotiza una llamada de razonamiento como entrada × precio_entrada + (salida_visible + pensamiento) × precio_salida por millón de tokens, calculando tres puntos: una estimación ingenua que ignora el pensamiento, una llamada típica (p50) en su recuento de pensamiento típico y una llamada de cola (p99) en p50 pensamiento × su múltiplo de cola. Informa el impuesto de razonamiento (la parte del pensamiento de la factura de p50), los totales mensuales típicos y finales en su volumen de llamadas y una tabla de sensibilidad en múltiplos finales para que pueda ver la banda presupuestaria completa.

Preguntas frecuentes

¿Por qué los modelos de razonamiento son tan impredecibles para el presupuesto?

Emiten tokens de pensamiento ocultos facturados como salida, y el conteo oscila desde unos pocos cientos en una indicación fácil hasta decenas de miles en una respuesta difícil. Si ajusta el presupuesto en una llamada típica, el final podrá facturar entre 3 y 5 veces más por llamada.

¿Cómo calculo el costo del token de razonamiento?

Costo por llamada = entrada × precio_entrada + (salida_visible + pensamiento) × precio_salida, por millón de tokens. El pensamiento se factura a la tasa de producción y es invisible y variable: estime un valor típico y un múltiplo de cola y ponga precio a ambos.

¿Qué es el impuesto de razonamiento?

La parte de tu factura que se oculta está pensando más que en la entrada o la respuesta. En llamadas de razonamiento intenso, habitualmente supera el 70-80%: se paga más por el trabajo preliminar que por la conversación visible.