—tokens de entrada/vídeo
—tokens de entrada / minuto
—costo mensual
La velocidad de fotogramas es el dial: barrerlo
Los tokens de imagen se escalan directamente con los fotogramas muestreados. Para imágenes lentas (conferencias, grabaciones de pantalla, transmisiones de seguridad), una velocidad de fotogramas más baja rara vez pierde algo y reduce la factura en proporción. El audio y el mensaje se mantienen en su configuración.
| Muestreo | Fichas de entrada/vídeo | Costo/vídeo | Mensual |
|---|
La modalidad que nadie presupuesta
El texto es barato, las imágenes son más caras y el vídeo pertenece a una categoría propia, porque un modelo convierte un vídeo en un muro de tokens de imágenes, un fotograma muestreado a la vez, y apila la pista de audio encima. La trampa de la intuición es pensar en un vídeo como "una entrada" como un documento; en realidad, un clip de diez minutos a un cuadro por segundo equivale a 600 cuadros, aproximadamente 155.000 tokens de imagen más 19.000 tokens de audio, y una hora completa cruza un millón de tokens de entrada antes de que el modelo produzca una sola palabra de salida. Es por eso que una función de comprensión de video que parecía trivial en una demostración puede dominar todo un proyecto de ley de IA una vez que se ejecuta en una biblioteca. Las palancas son directas: muestrear menos fotogramas por segundo, eliminar el audio cuando sólo necesite imágenes, transcribir voz con un modelo económico de voz a texto y razonar sobre el texto en lugar de pagar tarifas de token de audio, y recortar al segmento que importa. Tamaño de la alternativa de transcripción en el calculadora de costos de voz a texto, el lado de la imagen fija en la calculadora de entrada de imagen de visión, y la dirección de generación en el calculadora de costos de generación de video.
Costo de entrada de imágenes de visiónCosto de voz a textoCosto de generación de videoCosto de la API de GéminisCosto de API de visión
Cómo funciona esta calculadora
Cuenta los fotogramas muestreados (longitud en segundos × fotogramas por segundo), los multiplica por los tokens por fotograma para obtener tokens de imagen, suma tokens de audio (segundos × tokens de audio por segundo) y su mensaje para obtener el total de tokens de entrada, luego fija el precio de entrada y salida a sus tasas por millón. El costo por video multiplicado por su volumen mensual da como resultado la factura mensual, y la tabla vuelve a ejecutar todo en un rango de velocidades de fotogramas para que pueda ver la compensación.
Preguntas frecuentes
¿Cómo se factura el vídeo cuando lo envías a un LLM?
Un modelo multimodal no ve videos como lo hace una persona: toma muestras de cuadros, generalmente uno por segundo, y trata cada cuadro como una imagen hecha de tokens, luego agrega la pista de audio como su propio flujo de tokens. Entonces, el costo de entrada es el número de fotogramas muestreados multiplicado por los tokens por fotograma, más los tokens de audio y el mensaje de texto. Gemini factura aproximadamente 258 tokens por segundo de vídeo con resolución predeterminada y alrededor de 32 tokens por segundo de audio; con GPT-4o, usted mismo extrae los fotogramas y cada fotograma en mosaico abarca desde aproximadamente 85 hasta más de 1000 tokens, según el detalle. De cualquier manera, el vídeo es, con diferencia, la modalidad de entrada que más tokens consume, algo que esta calculadora concreta.
¿Por qué es tan caro analizar un vídeo de una hora?
Porque las fichas aumentan con la duración del metraje. A un fotograma por segundo y 258 tokens por fotograma, una hora de vídeo equivale a 3.600 fotogramas y alrededor de 929.000 tokens de imagen, además de aproximadamente 115.000 tokens de audio: más de un millón de tokens de entrada para un solo vídeo, antes de que el modelo escriba una palabra de respuesta. A unos pocos dólares por millón de tokens de entrada, esa es una factura significativa por video y se multiplica rápidamente en toda la biblioteca. La calculadora muestra los tokens por vídeo, el coste por vídeo y el total mensual para que un experimento único no se convierta en una sorpresa a gran escala.
¿Cómo puedo abaratar la comprensión del vídeo?
La palanca más importante es la velocidad de fotogramas: el muestreo de un fotograma cada dos o cinco segundos en lugar de uno por segundo corta los tokens de imagen proporcionalmente, y para secuencias de movimiento lento (una conferencia, una transmisión de seguridad, una grabación de pantalla) rara vez pierde algo importante. Eliminar la pista de audio cuando solo necesita imágenes, o transcribir audio con un modelo económico de voz a texto y alimentar la transcripción como texto en lugar de pagar tarifas de token de audio, es otro gran ahorro. Reducir la resolución de fotograma reduce los tokens por fotograma, y recortar el segmento relevante en lugar de enviar el archivo completo es la ganancia más sencilla de todas. La tabla de velocidad de cuadros en esta página muestra exactamente cuánto mueve cada configuración la factura.
¿Es más barato transcribir el audio que enviar el vídeo completo?
Muy a menudo sí, si tu pregunta es sobre lo que se dice más que sobre lo que se muestra. Los modelos de voz a texto cobran por minuto de audio una fracción de centavo, y la transcripción resultante son unos pocos miles de tokens de texto por una hora de conversación, órdenes de magnitud más baratas que pagar tarifas de tokens de imagen por fotograma cada segundo. Envíe el vídeo completo sólo cuando el contenido visual realmente importe; para imágenes de cabezas parlantes, reuniones y podcasts, transcriba primero y razone el texto. Esta calculadora le permite establecer tokens de audio en cero para modelar la ruta de la transcripción y compararla con el envío de los fotogramas.