Publicado em 08/08/2026 · números de referência, verifique antes de orçamentar
Envie exatamente a mesma imagem 1024×1024 para GPT-4o e para Claude e você obterá duas notas de token diferentes para dois pixels idênticos. GPT-4o sai aproximadamente 765 fichas. Claude sai para aproximadamente 1.400 fichas – quase o dobro. Nada na imagem mudou. Apenas a fórmula que o provedor usa para transformar pixels em tokens mudou, e a maioria das equipes que definem o preço "GPT-4o vs Claude" nunca passa da tabela de preços de texto para notar.
O preço do Vision depende da resolução – dimensões em pixels – e não do tamanho do arquivo. Um JPEG altamente compactado e um PNG nítido com a mesma largura e altura custam exatamente o mesmo, porque o modelo nunca vê o arquivo, ele vê pixels decodificados. O que difere é como cada provedor converte esses pixels em tokens faturáveis.
| Provedor | Fórmula | Imagem 1024×1024 | A captura |
|---|---|---|---|
| OpenAI GPT-4o (alto detalhe) | 85 base + 170 por bloco de 512px | ≈765 fichas | lado a lado significa escalas de custo com área de pixel, não linearmente com tamanho |
| OpenAI GPT-4o (baixo detalhe) | 85 fichas planas, qualquer tamanho | 85 fichas | a imagem é reduzida primeiro para uma miniatura - o texto fino não sobreviverá |
| Claude antrópico | largura × altura ÷ 750 | ≈1.400 fichas | sem saída de escape com poucos detalhes – cada imagem paga o preço total da área de pixel |
| Google Gêmeos | 258 tokens planos até 384×384, lado a lado além disso | 258 + lado a lado | mais barato para imagens pequenas, mas a contagem exata de blocos acima de 384px não é publicada de forma tão clara quanto as outras duas |
Fórmulas de referência publicadas por cada provedor, 2026. Os provedores arredondam e revisam as regras de blocos/pixels ao longo do tempo — relatar preço desatualizado →
Olhe para as duas linhas do meio. O modo de alto detalhe do OpenAI e o único modo do Anthropic pousam na mesma imagem de 1024×1024 com quase 2× de distância – 765 tokens contra aproximadamente 1.400 – porque o GPT-4o conta blocos de tamanho fixo enquanto Claude divide a área bruta de pixels por uma constante. Nenhum dos números está errado. Eles simplesmente não são o mesmo tipo de número, e uma equipe que calculou uma migração de Claude fora da linha de visão do GPT-4o terá quase o dobro quando as imagens começarem a fluir.
As comparações de preços do modelo têm como padrão o texto: dólares por milhão de tokens de entrada e saída, os números na tabela de preços. A visão é implementada como uma reflexão tardia, se é que é modelada. Isso é o contrário de muitos produtos reais – um aplicativo de controle de qualidade de documentos, um scanner de recibos, uma ferramenta de suporte que faz capturas de tela – onde cada solicitação carrega pelo menos uma imagem e a imagem supera facilmente o prompt em torno dela. Uma captura de tela de 1024×1024 com 1.400 tokens Claude pode ser maior do que a pergunta de texto perguntando sobre isso.
A lacuna aumenta com o volume da mesma forma que qualquer custo por solicitação. Com 100.000 imagens por mês, o GPT-4o de alto detalhe executa cerca de 76,5 milhões de tokens de imagem; o mesmo corpus sobre Claude roda cerca de 140 milhões – 63,5 milhões de tokens extras por mês que nunca aparecem se o modelo de custo for construído apenas com base no preço de texto. Compare isso com números somente de texto, como os de GPT vs Claude vs Gemini: qual API de IA é mais barata e uma carga de trabalho com muita visão pode inverter totalmente a classificação.
Porque o ladrilho é dimensionado com pixel área, duplicar a largura e a altura quase quadruplica a contagem de blocos e o custo – uma captura de tela de 2048×2048 custa várias vezes mais do que um corte de 768×768 custaria, para uma tarefa que nunca precisou de resolução extra em primeiro lugar. Reduzir para a menor resolução que ainda contenha os detalhes necessários é a maior alavanca no custo de visão, antes do fornecedor que você escolher.
A segunda alavanca é o modo de detalhe, e só existe no OpenAI: o baixo detalhe cobra 85 tokens, independentemente do tamanho da imagem, porque a imagem é reduzida para uma miniatura antes que o modelo a leia. Isso é bom para "o que é isso em geral" - um recibo, um gráfico, um gato - e inútil para a leitura de letras miúdas ou etiquetas pequenas, onde você precisa de resolução preservada de alto detalhe. Rotear imagens com poucos detalhes sempre que a tarefa precisa apenas da essência é um corte de 5 a 10x em vez de padronizar cada imagem com alto detalhe, que é o que a maioria das integrações faz sem pensar nisso.
Dois provedores podem agrupar ou dividir exatamente os mesmos pixels em contagens de tokens que diferem em cerca de 2×, e essa lacuna é invisível até que um produto com muitas imagens seja realmente enviado. A correção não custa nada: separe o item de linha de visão do item de linha de texto, reduza a escala antes de enviar e escolha o modo de detalhe propositalmente, em vez de por padrão.
Metodologia: as fórmulas e as contagens de tokens de referência são publicadas na documentação de cada fornecedor, comparadas com a calculadora de custos de visão do próprio site. Os provedores revisam periodicamente os tamanhos dos blocos e as taxas por bloco — tratem as contagens específicas aqui como um instantâneo a ser verificado, não como uma constante permanente. A comparação mensal de 100.000 imagens é um cenário ilustrativo construído a partir dos números por imagem acima, e não da telemetria de um sistema de produção.