HomeBlog › Costo del token de visión por proveedor

Misma imagen, factura diferente: lo que cuesta una imagen en GPT-4o vs Claude vs Gemini

Publicado 2026-08-08 · números de referencia, verificar antes de presupuestar

Envíe exactamente la misma imagen de 1024 × 1024 a GPT-4o y a Claude y obtendrá dos billetes de token diferentes para dos píxeles idénticos. GPT-4o sale aproximadamente 765 fichas. Claude sale con brusquedad 1.400 fichas – casi el doble. Nada en la imagen cambió. Solo cambió la fórmula que usa el proveedor para convertir píxeles en tokens, y la mayoría de los equipos que cotizan "GPT-4o vs Claude" nunca pasan de la hoja de tarifas de texto para darse cuenta.

Tres proveedores, tres fórmulas completamente diferentes

El precio de Vision depende de la resolución (dimensiones en píxeles) no del tamaño del archivo. Un JPEG muy comprimido y un PNG nítido con el mismo ancho y alto cuestan exactamente lo mismo, porque el modelo nunca ve el archivo, ve píxeles decodificados. La diferencia es cómo cada proveedor convierte esos píxeles en tokens facturables.

ProveedorFórmulaImagen de 1024 × 1024la captura
OpenAI GPT-4o (alto detalle)85 base + 170 por mosaico de 512 px≈765 fichasmosaico significa que el costo escala con el área de píxeles, no linealmente con el tamaño
OpenAI GPT-4o (detalle bajo)85 fichas planas, de cualquier tamaño.85 fichasla imagen se reduce primero a una miniatura; el texto fino no sobrevivirá
Claude antrópicoancho × alto ÷ 750≈1,400 fichassin trampilla de escape con poco detalle: cada imagen paga el precio total del área de píxeles
Google Géminis258 tokens planos hasta 384 × 384, en mosaico más allá de eso258 + mosaicomás barato para imágenes pequeñas, pero el recuento exacto de mosaicos por encima de 384 px no se publica tan claramente como los otros dos

Fórmulas de referencia publicadas por cada proveedor, 2026. Los proveedores redondean y revisan las reglas de mosaicos/píxeles a lo largo del tiempo: informar precio desactualizado →

Mira las dos filas del medio. El modo de alto detalle de OpenAI y el modo único de Anthropic aterrizan en la misma imagen de 1024×1024 con una separación de casi 2× (765 tokens contra aproximadamente 1,400) porque GPT-4o cuenta mosaicos de tamaño fijo mientras que Claude divide el área de píxeles sin procesar por una constante. Ningún número está mal. Simplemente no son el mismo tipo de número, y un equipo que fijó el precio de una migración de Claude fuera de la línea de visión de GPT-4o se quedará corto cerca del doble una vez que las imágenes comiencen a fluir.

Por qué esto se esconde dentro de una comparación de "precios de texto"

Las comparaciones de precios de modelos utilizan de forma predeterminada el texto: dólares por millón de tokens de entrada y salida, los números en la hoja de tarifas. La visión se incorpora como una ocurrencia tardía, si es que se modela. Esto es al revés para muchos productos reales (una aplicación de control de calidad de documentos, un escáner de recibos, una herramienta de soporte que toma capturas de pantalla) donde cada solicitud lleva al menos una imagen y la imagen supera fácilmente el mensaje que la rodea. Una captura de pantalla de 1024 × 1024 con 1400 tokens Claude puede ser más grande que la pregunta de texto al respecto.

La brecha se agrava con el volumen de la misma manera que lo hace cualquier costo por solicitud. Con 100.000 imágenes al mes, GPT-4o de alto detalle ejecuta alrededor de 76,5 millones de tokens de imágenes; el mismo corpus en Claude ejecuta alrededor de 140 millones: 63,5 millones de tokens adicionales por mes que nunca aparecen si el modelo de costos se construyó únicamente a partir de precios de texto. Compare eso con números de solo texto como los de GPT vs Claude vs Gemini: qué API de IA es más barata y una carga de trabajo con mucha visión puede cambiar la clasificación por completo.

Dos palancas que importan más que elegir un modelo "más barato"

Porque el mosaico escala con píxeles área, duplicar el ancho y el alto aproximadamente cuadriplica el número de mosaicos y el costo: una captura de pantalla de 2048 × 2048 cuesta varias veces más que un recorte de 768 × 768, para una tarea que nunca necesitó la resolución adicional en primer lugar. Reducir la escala a la resolución más pequeña que aún contenga los detalles que necesita es el factor más importante en el costo de la visión, por delante del proveedor que elija.

La segunda palanca es el modo de detalle, y solo existe en OpenAI: el nivel bajo de detalle cobra 85 tokens independientemente del tamaño de la imagen, porque la imagen se reduce a una miniatura antes de que el modelo la lea. Eso está bien para "qué es esto en general" (un recibo, un gráfico, un gato) e inútil para leer letras pequeñas o etiquetas pequeñas, donde se necesita una resolución preservada con alto nivel de detalle. Dirigir imágenes con poco detalle donde la tarea solo necesita lo esencial es un corte de 5 a 10 veces en lugar de configurar de forma predeterminada cada imagen con alto detalle, que es lo que hacen la mayoría de las integraciones sin pensar en ello.

¿Qué haríamos realmente con esto?

la comida para llevar

Dos proveedores pueden colocar en mosaico o dividir exactamente los mismos píxeles en recuentos de tokens que difieren cerca de 2 veces, y esa brecha es invisible hasta que se envía un producto con muchas imágenes. La solución no cuesta nada: separe la línea de pedido de visión de la línea de pedido de texto, reduzca la escala antes de enviar y elija el modo de detalle a propósito en lugar de por defecto.

Metodología: las fórmulas y los recuentos de tokens de referencia son los publicados en la documentación de cada proveedor y se cotejan con la calculadora de costos de visión de este sitio. Los proveedores revisan periódicamente los tamaños de los mosaicos y las tarifas por mosaico; trate los recuentos específicos aquí como una instantánea para verificar, no como una constante permanente. La comparación mensual de 100.000 imágenes es un escenario ilustrativo elaborado a partir de las cifras por imagen anteriores, no de la telemetría de un sistema de producción.