Publié 2026-08-08 · numéros de référence, vérifier avant de budgétiser
Envoyez exactement la même image 1024×1024 à GPT-4o et à Claude et vous obtenez deux factures de jetons différentes pour deux pixels identiques. GPT-4o sort à peu près 765 jetons. Claude sort à peu près 1 400 jetons – presque le double. Rien dans l’image n’a changé. Seule la formule utilisée par le fournisseur pour transformer les pixels en jetons a changé, et la plupart des équipes proposant les tarifs « GPT-4o vs Claude » ne dépassent jamais la grille tarifaire textuelle pour s'en apercevoir.
Le prix de Vision dépend de la résolution (des dimensions en pixels) et non de la taille du fichier. Un JPEG fortement compressé et un PNG net de même largeur et hauteur coûtent exactement le même prix, car le modèle ne voit jamais le fichier, il voit les pixels décodés. Ce qui diffère, c'est la façon dont chaque fournisseur convertit ces pixels en jetons facturables.
| Fournisseur | Formule | Image 1024×1024 | Le piège |
|---|---|---|---|
| OpenAI GPT-4o (détail élevé) | 85 de base + 170 par tuile de 512 px | ≈765 jetons | le carrelage signifie que le coût évolue avec la surface des pixels, et non linéairement avec la taille |
| OpenAI GPT-4o (faible détail) | plat 85 jetons, toute taille | 85 jetons | l'image est d'abord sous-échantillonnée en miniature ; le texte fin ne survivra pas |
| Claude Anthropique | largeur × hauteur ÷ 750 | ≈1 400 jetons | pas de trappe d'évacuation peu détaillée : chaque image paie le plein prix de la zone de pixels |
| Google Gémeaux | plat 258 jetons jusqu'à 384×384, carrelé au-delà | 258 + carrelage | le moins cher pour les petites images, mais le nombre exact de tuiles supérieur à 384 pixels n'est pas publié aussi clairement que les deux autres |
Formules de référence publiées par chaque fournisseur, 2026. Les fournisseurs arrondissent et révisent les règles de tuiles/pixels au fil du temps — signaler un prix obsolète →
Regardez les deux rangées du milieu. Le mode très détaillé d'OpenAI et le mode unique d'Anthropic atterrissent sur la même image 1024 × 1024 à près de 2 × l'un de l'autre - 765 jetons contre environ 1 400 - car GPT-4o compte les tuiles de taille fixe tandis que Claude divise la zone de pixels brute par une constante. Aucun des deux chiffres n’est faux. Ce n'est tout simplement pas le même genre de nombre, et une équipe qui a évalué une migration de Claude hors de la ligne de vision de GPT-4o sera près du double une fois que les images commenceront à circuler.
Les comparaisons de prix des modèles sont par défaut du texte : dollars par million de jetons d'entrée et de sortie, les chiffres sur la grille tarifaire. La vision est ajoutée après coup, si elle est modélisée. C'est l'inverse pour de nombreux produits réels - une application d'assurance qualité de documents, un scanner de reçus, un outil d'assistance qui prend des captures d'écran - où chaque demande contient au moins une image et l'image l'emporte facilement sur l'invite qui l'entoure. Une capture d'écran 1 024 × 1 024 à 1 400 jetons Claude peut être plus grande que la question textuelle la concernant.
L’écart s’accroît avec le volume de la même manière que n’importe quel coût par demande. Avec 100 000 images par mois, GPT-4o haute précision exécute environ 76,5 millions de jetons d'image ; le même corpus sur Claude gère environ 140 millions, soit 63,5 millions de jetons supplémentaires par mois qui n'apparaissent jamais si le modèle de coût était construit uniquement à partir de la tarification du texte. Comparez cela avec des nombres contenant uniquement du texte comme ceux de GPT vs Claude vs Gemini : quelle API IA est la moins chère et une charge de travail lourde de vision peut complètement renverser le classement.
Parce que le carrelage évolue avec le pixel zone, doubler la largeur et la hauteur quadruple à peu près le nombre de tuiles et le coût – une capture d’écran de 2048 × 2048 coûte plusieurs fois plus cher qu’un recadrage de 768 × 768, pour une tâche qui n’a jamais eu besoin d’une résolution supplémentaire en premier lieu. La réduction à la plus petite résolution contenant encore les détails dont vous avez besoin est le principal levier en matière de coût de la vision, avant le fournisseur que vous choisissez.
Le deuxième levier est le mode détail, et il n'existe que sur OpenAI : le faible niveau de détail facture 85 jetons quelle que soit la taille de l'image, car l'image est sous-échantillonnée en miniature avant que le modèle ne la lise. C'est bien pour "qu'est-ce que c'est en général" - un reçu, un graphique, un chat - et inutile pour lire des petits caractères ou de petites étiquettes, où vous avez besoin d'une résolution préservée avec des détails élevés. Le routage des images vers des détails faibles là où la tâche n'a besoin que de l'essentiel est une coupe de 5 à 10 × par rapport à la définition par défaut de chaque image vers des détails élevés, ce que font la plupart des intégrations sans y penser.
Deux fournisseurs peuvent mosaïquer ou diviser exactement les mêmes pixels en nombres de jetons qui diffèrent de près de 2 ×, et cet écart est invisible jusqu'à ce qu'un produit contenant beaucoup d'images soit réellement expédié. Le correctif ne coûte rien : séparez l'élément de campagne de vision de l'élément de campagne de texte, réduisez l'échelle avant l'envoi et choisissez le mode détail volontairement plutôt que par défaut.
Méthodologie : les formules et le nombre de jetons de référence sont tels que publiés dans la documentation de chaque fournisseur, vérifiés par recoupement avec le propre calculateur de coûts de vision de ce site. Les fournisseurs révisent périodiquement la taille des tuiles et les tarifs par tuile – traitez les décomptes spécifiques ici comme un instantané à vérifier, et non comme une constante permanente. La comparaison mensuelle de 100 000 images est un scénario illustratif construit à partir des chiffres par image ci-dessus, et non de la télémétrie d'un système de production.