HomeAI APIs › Coût d'entrée de l'image de vision
moins cher / mois
jetons par image (le moins cher)

Même image, chaque modèle de vision

La façon dont chaque modèle symbolise votre image et le coût mensuel des intrants selon votre volume – classé le moins cher en premier. Les jetons d'invite par image sont inclus dans le chiffre mensuel.

ModèleJetons d'imagePar imagePar mois
⚠️ Une estimation. Les formules de tokenisation d'image changent et varient selon la version exacte du modèle ; les fournisseurs arrondissent les tuiles et appliquent des minimums par image. Les prix sont des valeurs de référence pour 2026 : confirmez les taux d'entrée actuels par million et les règles de tokenisation de la vision pour votre modèle exact avant de budgétiser. · Signaler un prix obsolète →

Une image est un jeton d'entrée déguisé

Lorsque vous envoyez une image à un modèle de vision, celui-ci ne lit pas les pixels gratuitement : il convertit l'image en jetons et les facture au débit d'entrée, juste à côté de votre invite de texte. Le problème est que chaque fournisseur compte ces jetons différemment, et aucun d’entre eux ne compte en fonction de la taille du fichier. Le GPT-4o d'OpenAI adapte l'image dans une grille de tuiles de 512 pixels et facture 85 jetons de base plus 170 par tuile. Claude d'Anthropic utilise approximativement la largeur multipliée par la hauteur divisée par 750. Gemini de Google facture un forfait de 258 jetons pour les petites images et les tuiles plus grandes. La même capture d'écran 1 024 × 1 024 peut donc contenir 765 jetons sur un modèle et 1 400 sur un autre – un swing proche de 2 × avant que vous n'ayez écrit un seul mot d'instruction.

C'est ce qui compte le plus en termes de volume. Un pipeline de traitement de documents, un flux de modération ou une fonctionnalité de « discussion avec vos captures d'écran » peuvent transmettre des dizaines de milliers d'images par jour, et dans ce cas, les jetons d'image éclipsent l'invite. Ce calculateur rend le compromis visible : il montre comment chaque modèle symbolise votre résolution exacte et ce que cela coûte par mois, afin que vous puissiez choisir le modèle de vision le moins cher pour votre mélange d'images et voir instantanément combien vous économiseriez en réduisant l'échelle. Associez-le avec le compteur de jetons pour le côté texte et le outil API LLM le moins cher pour le choix global du modèle.

Comment l'utiliser

1. Entrez la largeur et la hauteur des images que vous envoyez – la résolution après tout redimensionnement que vous avez déjà effectué.
2. Choisissez le mode de détail d'OpenAI : le mode élevé lit le texte fin et les petites étiquettes, le mode faible s'aplatit en une vignette de 85 jetons.
3. Entrez le nombre d'images que vous envoyez par mois et éventuellement les jetons d'invite qui accompagnent chacune.
4. Lisez le tableau de classement pour voir le modèle de vision le moins cher pour la taille de votre image et le coût mensuel.

Erreurs courantes

Envoi en pleine résolution lorsqu'un recadrage ferait l'affaire. Le coût du jeton augmente avec la zone de pixels, de sorte qu'une image de 2048² peut coûter quatre fois celle de 1024² pour des détails dont le modèle n'a jamais eu besoin. Laisser les détails en haut par défaut. Si vous n'avez besoin que de l'essentiel, le mode peu détaillé correspond à 85 jetons plats, ce qui représente souvent une économie de 5 à 10 fois. Oublier l’invite compte toujours. Les jetons d'image se trouvent au-dessus de votre invite de texte et de toute invite système, de sorte que le coût réel par appel est tous deux additionnés. Ignorer la sortie. Cet outil évalue l'image en entrée ; la réponse écrite du modèle est facturée séparément au tarif de sortie.

FAQ

Un fichier plus gros coûte-t-il plus cher ?

Non : le coût du jeton suit les dimensions en pixels, pas en octets. Un JPEG 2048² fortement compressé et un PNG 2048² net coûtent le même nombre de jetons ; seules la largeur et la hauteur comptent.

Comment puis-je réduire au maximum le coût de saisie des images ?

Réduisez l'échelle à la plus petite résolution qui affiche toujours les détails dont vous avez besoin et utilisez le mode peu de détails là où la tâche n'a besoin que de l'essentiel. Ensemble, ces deux leviers réduisent régulièrement de plusieurs fois le coût des intrants en matière de vision.

S'agit-il des formules exactes des fournisseurs ?

Ce sont des implémentations de référence fidèles des règles publiées en matière de tuiles et de pixels en 2026, mais les fournisseurs les arrondissent et les révisent. Traitez le nombre de jetons comme des estimations serrées et confirmez-les par rapport au propre tokeniseur de votre fournisseur pour les numéros de facturation.

Et la vidéo ?

La vidéo est généralement facturée sous la forme d'une séquence d'images échantillonnées, chacune étant tarifée comme une image. Estimez le nombre d'images par seconde des échantillons du modèle, multipliez par secondes et traitez chaque image comme une image dans cet outil.

Estimation seulement. La tokenisation de la vision et les taux d'entrée par million changent : vérifiez auprès de votre fournisseur avant de vous fier à ces chiffres.

Hébergez votre projet :DigitalOcean — 200 $ gratuits ↗VPS Hostinger
Google GémeauxCoinGeckoIA et LLMÉchanges de crypto-monnaiePaiements