Questions fréquemment posées
Comment le coût de l’image est-il calculé pour les modèles de vision ?
Les modèles Vision divisent une image en tuiles de 512 pixels. La tarification de type GPT-4o facture une base fixe (environ 85 jetons) plus environ 170 jetons par tuile, puis les facture comme des jetons d'entrée normaux. Une image 1024×1024 correspond à quatre tuiles, soit environ 765 jetons – plus il y a de mégapixels, plus il y a de tuiles et de jetons.
Comment puis-je réduire le coût de l'API de vision ?
Réduisez l’échelle des images avant de les envoyer : la résolution détermine le nombre de vignettes et la plupart des tâches ne nécessitent pas la pleine résolution. Utilisez le mode peu détaillé lorsque le modèle le propose (un coût symbolique fixe et bon marché), recadrez dans la région qui compte et évitez de renvoyer la même image à chaque tour d'une conversation.