Géminis ≈ 258 tok/s de vídeo, 32 tok/s de audio
costo por video
tokens de entrada/vídeo
tokens de entrada / minuto
costo mensual

La velocidad de fotogramas es el dial: barrerlo

Los tokens de imagen se escalan directamente con los fotogramas muestreados. Para imágenes lentas (conferencias, grabaciones de pantalla, transmisiones de seguridad), una velocidad de fotogramas más baja rara vez pierde algo y reduce la factura en proporción. El audio y el mensaje se mantienen en su configuración.

MuestreoFichas de entrada/vídeoCosto/vídeoMensual

La modalidad que nadie presupuesta

El texto es barato, las imágenes son más caras y el vídeo pertenece a una categoría propia, porque un modelo convierte un vídeo en un muro de tokens de imágenes, un fotograma muestreado a la vez, y apila la pista de audio encima. La trampa de la intuición es pensar en un vídeo como "una entrada" como un documento; en realidad, un clip de diez minutos a un cuadro por segundo equivale a 600 cuadros, aproximadamente 155.000 tokens de imagen más 19.000 tokens de audio, y una hora completa cruza un millón de tokens de entrada antes de que el modelo produzca una sola palabra de salida. Es por eso que una función de comprensión de video que parecía trivial en una demostración puede dominar todo un proyecto de ley de IA una vez que se ejecuta en una biblioteca. Las palancas son directas: muestrear menos fotogramas por segundo, eliminar el audio cuando sólo necesite imágenes, transcribir voz con un modelo económico de voz a texto y razonar sobre el texto en lugar de pagar tarifas de token de audio, y recortar al segmento que importa. Tamaño de la alternativa de transcripción en el calculadora de costos de voz a texto, el lado de la imagen fija en la calculadora de entrada de imagen de visión, y la dirección de generación en el calculadora de costos de generación de video.

Aloja tu proyecto:Océano Digital — $200 gratis ↗VPS Hostinger
Costo de entrada de imágenes de visiónCosto de voz a textoCosto de generación de videoCosto de la API de GéminisCosto de API de visión