—tokens de entrada/vídeo
—tokens de entrada/minuto
—custo mensal
A taxa de quadros é o mostrador – varrendo-o
Os tokens de imagem são dimensionados diretamente com os quadros amostrados. Para filmagens lentas – palestras, gravações de tela, feeds de segurança – uma taxa de quadros mais baixa raramente perde alguma coisa e reduz o custo proporcionalmente. Áudio e prompt são mantidos em suas configurações.
| Amostragem | Tokens de entrada/vídeo | Custo / vídeo | Mensal |
|---|
A modalidade que ninguém orçamenta
O texto é barato, as imagens são mais caras e o vídeo está em uma categoria própria – porque um modelo transforma um vídeo em uma parede de tokens de imagem, um quadro amostrado por vez, e empilha a trilha de áudio no topo. A armadilha da intuição é pensar em um vídeo como “uma entrada”, como um documento; na realidade, um clipe de dez minutos a um quadro por segundo equivale a 600 quadros, cerca de 155.000 tokens de imagem mais 19.000 tokens de áudio, e uma hora inteira atravessa um milhão de tokens de entrada antes que o modelo produza uma única palavra de saída. É por isso que um recurso de compreensão de vídeo que parecia trivial em uma demonstração pode dominar todo um projeto de IA quando executado em uma biblioteca. As alavancas são diretas: amostrar menos quadros por segundo, descartar o áudio quando você precisar apenas dos recursos visuais, transcrever a fala com um modelo barato de fala para texto e raciocinar sobre o texto em vez de pagar taxas de token de áudio e recortar para o segmento que importa. Dimensione a alternativa de transcrição no calculadora de custos de fala para texto, o lado da imagem estática no calculadora de entrada de imagem de visão, e a direção de geração no calculadora de custos de geração de vídeo.
Custo de entrada de imagem de visãoCusto de fala para textoCusto de geração de vídeoCusto da API GeminiCusto da API Vision
Como funciona esta calculadora
Ele conta os quadros amostrados (comprimento em segundos × quadros por segundo), multiplica pelos tokens por quadro para obter tokens de imagem, adiciona tokens de áudio (segundos × tokens de áudio por segundo) e seu prompt para obter o total de tokens de entrada e, em seguida, precifica a entrada e a saída de acordo com suas taxas por milhão. O custo por vídeo multiplicado pelo seu volume mensal fornece a fatura mensal, e a tabela repete tudo em uma faixa de taxas de quadros para que você possa ver a compensação.
Perguntas frequentes
Como o vídeo é cobrado quando você o envia para um LLM?
Um modelo multimodal não assiste a vídeos da mesma forma que uma pessoa – ele faz amostras de quadros, geralmente cerca de um por segundo, e trata cada quadro como uma imagem feita de tokens e, em seguida, adiciona a trilha de áudio como seu próprio fluxo de tokens. Portanto, o custo de entrada é o número de quadros amostrados vezes os tokens por quadro, mais os tokens de áudio e o prompt de texto. Gemini fatura cerca de 258 tokens por segundo de vídeo na resolução padrão e cerca de 32 tokens por segundo de áudio; com o GPT-4o você mesmo extrai os quadros e cada quadro lado a lado varia de cerca de 85 a mais de 1.000 tokens, dependendo dos detalhes. De qualquer forma, o vídeo é de longe a modalidade de entrada que mais exige tokens, o que esta calculadora torna concreto.
Por que é tão caro analisar um vídeo de uma hora?
Porque os tokens aumentam de acordo com a duração da filmagem. Com um quadro por segundo e 258 tokens por quadro, uma hora de vídeo equivale a 3.600 quadros e cerca de 929.000 tokens de imagem, além de cerca de 115.000 tokens de áudio – bem mais de um milhão de tokens de entrada para um único vídeo, antes que o modelo escreva uma palavra de resposta. Com alguns dólares por milhão de tokens de entrada, isso representa uma conta significativa por vídeo e se multiplica rapidamente em uma biblioteca. A calculadora mostra os tokens por vídeo, o custo por vídeo e o total mensal para que um experimento único não se transforme em uma surpresa em grande escala.
Como posso tornar a compreensão do vídeo mais barata?
A maior vantagem é a taxa de quadros: a amostragem de um quadro a cada dois ou cinco segundos, em vez de um por segundo, corta os tokens de imagem proporcionalmente e, para filmagens lentas – uma palestra, um feed de segurança, uma gravação de tela – raramente perde algo que importa. Abandonar a trilha de áudio quando você só precisa dos recursos visuais ou transcrever o áudio com um modelo barato de fala para texto e alimentar a transcrição como texto em vez de pagar taxas de token de áudio é outra grande economia. Reduzir a resolução do quadro reduz os tokens por quadro, e recortar para o segmento relevante em vez de enviar o arquivo inteiro é a vitória mais simples de todas. A tabela de taxa de quadros nesta página mostra exatamente o quanto cada configuração movimenta a conta.
É mais barato transcrever o áudio do que enviar o vídeo inteiro?
Muitas vezes, sim, se a sua pergunta for sobre o que é dito e não sobre o que é mostrado. Os modelos de fala para texto cobram por minuto de áudio uma fração de centavo, e a transcrição resultante são alguns milhares de tokens de texto por uma hora de fala – ordens de magnitude mais baratas do que pagar taxas de token de imagem em um quadro a cada segundo. Envie o vídeo completo somente quando o conteúdo visual for realmente importante; para filmagens, reuniões e podcasts de talk-heads, transcreva primeiro e raciocine sobre o texto. Esta calculadora permite definir tokens de áudio como zero para modelar a rota de transcrição e compará-la com o envio de quadros.