HomeBlog › Стоимость токенов Vision по поставщикам

То же изображение, другой счет: сколько стоит изображение на GPT-4o vs Claude vs Gemini

Опубликовано 8 августа 2026 г. · справочные номера, проверьте перед составлением бюджета

Отправьте одно и то же изображение 1024×1024 в GPT-4o и в Claude, и вы получите два разных счета за два одинаковых пикселя. GPT-4o выходит примерно 765 жетонов. Клод выходит примерно 1400 жетонов — почти вдвое. В изображении ничего не изменилось. Изменилась только формула, которую провайдер использует для преобразования пикселей в токены, и большинство команд, оценивающих «GPT-4o против Claude», никогда не обращают внимания на текстовые тарифы.

Три провайдера, три совершенно разные формулы

Цена Vision зависит от разрешения (размеров в пикселях), а не от размера файла. Сильно сжатый JPEG и четкий PNG одинаковой ширины и высоты стоят одинаково, потому что модель никогда не видит файл, а видит декодированные пиксели. Отличие заключается в том, как каждый провайдер конвертирует эти пиксели в оплачиваемые токены.

ПоставщикФормулаИзображение 1024×1024Улов
OpenAI GPT-4o (высокая детализация)85 базовых + 170 за тайл размером 512 пикселей≈765 токеновТайлинг означает, что стоимость зависит от площади пикселя, а не линейно от размера.
OpenAI GPT-4o (низкая детализация)плоские 85 жетонов любого размера85 жетоновизображение сначала уменьшается до миниатюры — мелкий текст не сохранится
Антропный Клодширина × высота ÷ 750≈1400 токеновнет аварийного люка с низкой детализацией — каждое изображение платит полную цену за площадь пикселя
Гугл Близнецыплоские 258 жетонов размером до 384×384, за пределами которых расположены плитки258 + плиткасамый дешевый для небольших изображений, но точное количество плиток выше 384 пикселей публикуется не так четко, как два других

Справочные формулы, опубликованные каждым поставщиком, 2026 г. Поставщики со временем округляют и пересматривают правила тайлов/пикселей — сообщить устаревшую цену →

Посмотрите на два средних ряда. Режим высокой детализации OpenAI и единственный режим Anthropic размещаются на одном и том же изображении 1024×1024 с разницей почти в 2 раза — 765 токенов против примерно 1400 — потому что GPT-4o считает плитки фиксированного размера, а Клод делит область необработанных пикселей на константу. Ни одно из чисел не является неправильным. Это просто разные цифры, и команда, которая оценила миграцию Клода вне поля зрения GPT-4o, потеряет почти вдвое меньше, как только начнут поступать изображения.

Почему это скрывается внутри сравнения «текстовых цен»

Сравнение цен моделей по умолчанию отображается текстом: доллары за миллион входных и выходных токенов, цифры в прейскуранте. Видение привязывается в последнюю очередь, если оно вообще моделируется. Это наоборот для многих реальных продуктов — приложения для контроля качества документов, сканера квитанций, инструмента поддержки, который делает снимки экрана — где каждый запрос содержит по крайней мере одно изображение, и изображение легко перевешивает подсказку вокруг него. Скриншот размером 1024×1024 при 1400 токенах Claude может быть больше, чем текстовый вопрос, задающий вопрос.

Разрыв увеличивается с объемом так же, как и любая стоимость за запрос. При обработке 100 000 изображений в месяц GPT-4o с высокой детализацией обрабатывает около 76,5 млн токенов изображений; тот же корпус на Claude насчитывает около 140 миллионов — дополнительные 63,5 миллиона токенов в месяц, которые никогда не появятся, если модель затрат будет построена только на текстовых ценах. Сравните это с текстовыми числами, такими как приведенные в GPT против Claude против Gemini: какой AI API дешевле а большая нагрузка на видение может полностью перевернуть рейтинг.

Два рычага, которые важнее, чем выбор «более дешевой» модели

Поскольку тайлинг масштабируется в зависимости от пикселя область, удвоение ширины и высоты примерно в четыре раза увеличивает количество фрагментов и стоимость — снимок экрана 2048×2048 стоит в несколько раз дороже, чем кадрирование 768×768, для задачи, которая вообще никогда не требовала дополнительного разрешения. Уменьшение масштаба до наименьшего разрешения, которое по-прежнему содержит необходимую вам детализацию, является самым большим фактором, влияющим на стоимость машинного зрения, перед тем, какого поставщика вы выберете.

Второй рычаг — это режим детализации, и он существует только в OpenAI: при низкой детализации взимается фиксированная плата в размере 85 токенов независимо от размера изображения, поскольку перед тем, как модель прочитает его, изображение понижается до миниатюры. Это нормально для того, «что это вообще такое» — квитанция, карта, кот — и бесполезно для чтения мелкого шрифта или небольших этикеток, где вам нужно сохранить высокое разрешение деталей. Перенаправление изображений на низкую детализацию там, где для задачи требуется только суть, — это сокращение в 5–10 раз по сравнению с установкой каждого изображения по умолчанию на высокую детализацию, что большинство интеграций делают, не задумываясь об этом.

Что мы на самом деле будем с этим делать

Вывод

Два поставщика могут объединить или разделить одни и те же пиксели на количество токенов, которые различаются почти в 2 раза, и этот разрыв невидим до тех пор, пока продукт с большим количеством изображений действительно не будет отправлен. Исправление ничего не стоит: отделите строку визуального представления от позиции текста, уменьшите масштаб перед отправкой и выберите режим детализации специально, а не по умолчанию.

Методология: формулы и количество ссылочных токенов указаны в документации каждого поставщика и сверены с собственным калькулятором стоимости видения этого сайта. Провайдеры периодически пересматривают размеры плиток и тарифы за плитку — рассматривайте конкретные значения здесь как моментальный снимок для проверки, а не как постоянную константу. Ежемесячное сравнение 100 000 изображений — это иллюстративный сценарий, построенный на основе приведенных выше значений по каждому изображению, а не телеметрии из производственной системы.