Perguntas frequentes
Como o custo da imagem é calculado para modelos de visão?
Os modelos de visão dividem uma imagem em blocos de 512 pixels. O preço no estilo GPT-4o cobra uma base fixa (cerca de 85 tokens) mais cerca de 170 tokens por bloco e, em seguida, cobra-os como tokens de entrada normais. Uma imagem de 1024×1024 tem quatro blocos, ou seja, cerca de 765 tokens – quanto mais megapixels, mais blocos e tokens.
Como posso reduzir o custo da API de visão?
Reduza as imagens antes de enviá-las – a resolução aumenta a contagem de blocos e a maioria das tarefas não precisa de resolução total. Use o modo de poucos detalhes quando o modelo oferecer (um custo de token fixo e barato), corte na região que importa e evite reenviar a mesma imagem nos turnos de uma conversa.