Comment fonctionne cette calculatrice
Le Calculateur de coût de l'API Vision estime ce que vous paierez pour envoyer des images à un modèle de vision de type GPT-4o. Vous entrez une image largeur et hauteur en pixels, et l'outil convertit ces dimensions en nombre de jetons d'entrée le modèle est facturé, car les modèles de vision mosaïquent et évaluent les images en fonction de la résolution plutôt que de la taille du fichier. Multipliez ce nombre de jetons par votre $ par million de jetons d'entrée tarif pour obtenir un coût par image, puis par votre images par mois pour projeter une facture mensuelle. Les deux principaux facteurs sont la résolution de l'image, qui définit les jetons par image, et le volume mensuel, qui fait évoluer le total.
Le principal compromis à surveiller est résolution versus coût: les images plus grandes consomment plus de jetons, donc une petite augmentation de dimension peut augmenter considérablement votre facture à grande échelle. Avant l'envoi, réduire l'échelle images à la plus petite taille que votre tâche lit toujours avec précision, et estimez d'abord les charges de travail à volume élevé ici afin qu'une surprise de prix n'arrive pas sur votre facture.
Questions fréquemment posées
Comment le coût de l’image est-il calculé pour les modèles de vision ?
Les modèles Vision divisent une image en tuiles de 512 pixels. La tarification de type GPT-4o facture une base fixe (environ 85 jetons) plus environ 170 jetons par tuile, puis les facture comme des jetons d'entrée normaux. Une image 1024×1024 correspond à quatre tuiles, soit environ 765 jetons – plus il y a de mégapixels, plus il y a de tuiles et de jetons.
Comment puis-je réduire le coût de l'API de vision ?
Réduisez l’échelle des images avant de les envoyer : la résolution détermine le nombre de vignettes et la plupart des tâches ne nécessitent pas la pleine résolution. Utilisez le mode peu détaillé lorsque le modèle le propose (un coût symbolique fixe et bon marché), recadrez dans la région qui compte et évitez de renvoyer la même image à chaque tour d'une conversation.