Gemini ≈ 258 tok/s de vídeo, 32 tok/s de áudio
custo por vídeo
tokens de entrada/vídeo
tokens de entrada/minuto
custo mensal

A taxa de quadros é o mostrador – varrendo-o

Os tokens de imagem são dimensionados diretamente com os quadros amostrados. Para filmagens lentas – palestras, gravações de tela, feeds de segurança – uma taxa de quadros mais baixa raramente perde alguma coisa e reduz o custo proporcionalmente. Áudio e prompt são mantidos em suas configurações.

AmostragemTokens de entrada/vídeoCusto / vídeoMensal

A modalidade que ninguém orçamenta

O texto é barato, as imagens são mais caras e o vídeo está em uma categoria própria – porque um modelo transforma um vídeo em uma parede de tokens de imagem, um quadro amostrado por vez, e empilha a trilha de áudio no topo. A armadilha da intuição é pensar em um vídeo como “uma entrada”, como um documento; na realidade, um clipe de dez minutos a um quadro por segundo equivale a 600 quadros, cerca de 155.000 tokens de imagem mais 19.000 tokens de áudio, e uma hora inteira atravessa um milhão de tokens de entrada antes que o modelo produza uma única palavra de saída. É por isso que um recurso de compreensão de vídeo que parecia trivial em uma demonstração pode dominar todo um projeto de IA quando executado em uma biblioteca. As alavancas são diretas: amostrar menos quadros por segundo, descartar o áudio quando você precisar apenas dos recursos visuais, transcrever a fala com um modelo barato de fala para texto e raciocinar sobre o texto em vez de pagar taxas de token de áudio e recortar para o segmento que importa. Dimensione a alternativa de transcrição no calculadora de custos de fala para texto, o lado da imagem estática no calculadora de entrada de imagem de visão, e a direção de geração no calculadora de custos de geração de vídeo.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Custo de entrada de imagem de visãoCusto de fala para textoCusto de geração de vídeoCusto da API GeminiCusto da API Vision