HomeAI APIs › Costo de entrada de imágenes de visión
más barato / mes
tokens por imagen (más barato)

Misma imagen, cada modelo de visión.

Cómo cada modelo tokeniza su imagen y el costo de entrada mensual en su volumen: clasificado como el más barato en primer lugar. Los tokens rápidos por imagen se incluyen en la cifra mensual.

ModeloFichas de imagenPor imagenPor mes
⚠️Un presupuesto. Las fórmulas de tokenización de imágenes cambian y varían según la versión exacta del modelo; Los proveedores redondean mosaicos y aplican mínimos por imagen. Los precios son valores de referencia para 2026: confirme las tasas de entrada por millón actuales y las reglas de tokenización de visión para su modelo exacto antes de realizar el presupuesto. · Informar precio desactualizado →

Una imagen es tokens de entrada disfrazados.

Cuando envía una imagen a un modelo de visión, este no lee los píxeles de forma gratuita: convierte la imagen en tokens y los carga a la velocidad de entrada, junto con el mensaje de texto. El problema es que cada proveedor cuenta esos tokens de manera diferente y ninguno cuenta por tamaño de archivo. GPT-4o de OpenAI ajusta la imagen en una cuadrícula de mosaicos de 512 píxeles y carga 85 tokens base más 170 por mosaico. Claude de Anthropic utiliza aproximadamente ancho por alto dividido por 750. Gemini de Google cobra 258 tokens fijos por imágenes pequeñas y mosaicos por imágenes más grandes. Por lo tanto, la misma captura de pantalla de 1024 × 1024 puede tener 765 tokens en un modelo y 1400 en otro: un swing de casi 2 × antes de haber escrito una sola palabra de instrucción.

Eso importa más en volumen. Un canal de procesamiento de documentos, un feed de moderación o una función de "chatear con sus capturas de pantalla" pueden generar decenas de miles de imágenes al día y, en esos recuentos, los tokens de imágenes eclipsan el mensaje. Esta calculadora hace que la compensación sea visible: muestra cómo cada modelo tokeniza su resolución exacta y cuánto cuesta por mes, para que pueda elegir el modelo de visión más barato para su combinación de imágenes y ver instantáneamente cuánto ahorraría al reducir la escala. Combínalo con el contador de fichas para el lado del texto y el la herramienta API LLM más barata para la elección general del modelo.

como usarlo

1. Ingrese el ancho y el alto de las imágenes que envía: la resolución después de cualquier cambio de tamaño que ya realice.
2. Elija el modo de detalle de OpenAI: alto lee texto fino y etiquetas pequeñas, bajo se aplana a una miniatura de 85 tokens.
3. Ingrese cuántas imágenes envía por mes y, opcionalmente, los tokens de aviso que acompañan a cada una.
4. Lea la tabla clasificada para ver el modelo de visión más económico para el tamaño de su imagen y el costo mensual.

Errores comunes

Envío en resolución completa cuando sería suficiente con un recorte. El costo del token crece con el área de píxeles, por lo que una imagen de 2048² puede costar cuatro veces más que una de 1024² por detalles que el modelo nunca necesitó. Dejando los detalles en alto de forma predeterminada. Si solo necesita lo esencial, el modo de bajo detalle es de 85 tokens fijos, a menudo un ahorro de 5 a 10 veces. Olvidar el mensaje todavía cuenta. Los tokens de imagen están encima del mensaje de texto y de cualquier mensaje del sistema, por lo que el costo real por llamada se suma. Ignorando la salida. Esta herramienta valora la imagen como entrada; La respuesta escrita del modelo se factura por separado a la tarifa de salida.

Preguntas frecuentes

¿Cuesta más un archivo más grande?

No: el costo del token rastrea las dimensiones en píxeles, no los bytes. Un JPEG de 2048² muy comprimido y un PNG nítido de 2048² cuestan la misma cantidad de tokens; Sólo importan el ancho y el alto.

¿Cómo puedo reducir al máximo el costo de entrada de imágenes?

Reduzca la escala a la resolución más pequeña que aún muestre los detalles que necesita y use el modo de bajo detalle donde la tarea solo necesite lo esencial. Juntas, esas dos palancas rutinariamente reducen varias veces el costo de la información visual.

¿Son estas las fórmulas exactas del proveedor?

Son implementaciones de referencia fieles de las reglas de píxeles y mosaicos publicadas en 2026, pero los proveedores las redondean y revisan. Trate los recuentos de tokens como estimaciones ajustadas y confírmelos con el tokenizador de su proveedor para obtener números de grado de facturación.

¿Qué pasa con el vídeo?

El vídeo normalmente se cobra como una secuencia de cuadros de muestra, cada uno con el precio de una imagen. Calcule los fotogramas por segundo de las muestras del modelo, multiplíquelos por segundos y trate cada fotograma como una imagen en esta herramienta.

Estimación únicamente. La tokenización de visión y las tasas de entrada por millón cambian: verifique con su proveedor antes de confiar en estas cifras.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
Google GéminisMonedaGeckoIA y LLMIntercambios de cifradoPagos