Крах пограничных цен в визуализации
Входная цена за 1 миллион токенов для лучшей общедоступной модели «пограничного класса» на каждую дату. Тот же уровень возможностей, с разницей в три года.
Не та модель — та же самая сорт возможностей. В этом различии и заключается вся история: модели не дешевеют, а уровни возможностей дешевеют, поскольку новые модели превращают вчерашний рубеж в товар.
Хронология каждого крупного ценового события
Цена, определяющая «дорогой ИИ». Один тяжелый сеанс чата может стоить долларов. GPT-3.5 Turbo по цене 2/2 доллара был рабочей лошадкой для больших объемов продаж.
Anthropic уступает GPT-4 примерно на 60 % с контекстным окном в 100 тысяч — первое реальное ценовое давление на пограничном уровне.
Первое большое сокращение OpenAI. Быстрее, 128 тысяч контекста и втрое дешевле. Шаблон установлен: каждое поколение становится лучше и дешевле.
Трехуровневое меню становится отраслевым шаблоном. Haiku по цене 0,25 доллара делает рабочие нагрузки в миллион токенов простыми; Opus устанавливает потолок премиум-класса.
Почти граничное качество при цене на два порядка ниже стартовой цены GPT-4. Вызывает немедленную ценовую войну среди китайских провайдеров (Alibaba, ByteDance сокращена в течение нескольких дней) и навсегда сбрасывает значение слова «дешево».
Половина цены Turbo, включая мультимодальные перевозки. Входные данные Frontier теперь в 6 раз дешевле, чем 14 месяцев назад.
Лучше, чем GPT-3.5 Turbo, менее чем за треть его цены. «Бюджетный уровень» сейчас превосходит границу 2023 года по большинству задач.
Второй халвинг за четыре месяца. С момента запуска GPT-4 — 17 месяцев — входная граница упала в 12 раз.
Стоимость Gemini 1.5 Flash снижена с 0,35 до 0,075 доллара США; 1.5 Pro от 3,50 до 1,25 доллара. Google покупает долю рынка, совершая самые резкие устойчивые сокращения среди всех крупных поставщиков.
Стоит запомнить противоположный пример: Anthropic оценила новый Haiku 3.2× выше, чем его предшественник, аргументируя это тем, что его возможности оправдывают эту цену. Дефляция — это тенденция, а не закон: бюджетные уровни могут и действительно переоцениваются в сторону повышения, когда модель дает завышенные результаты.
Модели рассуждения сбрасывают потолок — и вводят невидимые затраты «жетонов мышления», когда вы платите за цепочку мыслей, которую никогда не видите. Новый премиальный уровень появится в ценах 2023 года.
Второй шок от DeepSeek: рассуждения класса o1 за небольшую цену, весы открыты. Кратковременно стирает рыночную капитализацию Nvidia примерно на 600 миллиардов долларов — в тот момент, когда рынки, оцененные в этом выводе, становились дешевыми.
Самое большое процентное снижение флагманской модели рассуждения — o3 падает до $2/$8 за одну ночь, подрывая цену своего меньшего брата и подтверждая, что уровень рассуждений следует той же кривой дефляции, только быстрее.
Модели класса Llama-4, Qwen и DeepSeek, обслуживаемые Together, Fireworks, Groq и DeepInfra, ставят возможности уровня GPT-4 ниже 1 доллара за миллион токенов. Закрытые модели Frontier (GPT-5.5 за 5 долларов, уровень Claude Opus) имеют премиальную цену, но разрыв, который они должны оправдывать, продолжает увеличиваться.
Что на самом деле говорят данные за три года
1. Уровень возможностей снижается примерно в 10 раз в год; отдельные модели редко дешевеют. Прейскурантная цена GPT-4o была снижена вдвое, но более важным механизмом является замена: новая модель поставляется на более низком уровне старой модели. Бюджет для уровня, а не для названия модели.
2. Цены на продукцию падают медленнее, чем на ресурсы. Результат запуска GPT-4 составил 2 × вход (60 долларов США против 30 долларов США); сегодня стандартными являются коэффициенты 4–5× (GPT-4o: 10 долларов против 2,50 долларов). Провайдеры защищают маржу по генерации. Если ваша рабочая нагрузка связана с большим количеством результатов — длинные ответы, генерация кода — ваше эффективное дефлятирование происходит значительно медленнее, чем предполагают заголовки.
3. Рост цен случается. Claude 3.5 Haiku (+220%) — самый известный. Когда «маленькая» модель соответствует среднему уровню, ее цена зависит от возможностей, а не от происхождения. Никогда не запрограммируйте жестко предположение о том, что дешевый уровень остается дешевым.
4. Потрясения приходят извне. Оба прерывистых сокращения (май 2024 г. и январь 2025 г.) произошли от DeepSeek, а не от действующего конкурента. Следующее изменение цен, вероятно, также произойдет откуда-то неожиданно, что свидетельствует в пользу независимости от поставщика, а не глубокой интеграции с одним поставщиком.
Что это значит для вашего бюджета
Скидка на долгосрочные прогнозы. Функция, которая сегодня стоит 10 тысяч долларов в месяц за вызовы API, вероятно, будет стоить 1–3 тысячи долларов в месяц при том же качестве через 18 месяцев. Экономика подразделений ИИ, которая сейчас выглядит маргинальной, часто хорошо работает на кривой дефляции, а гарантированные годовые контракты по сегодняшним ставкам борются с этой кривой.
Делайте повторные покупки ежеквартально. The Сравнительная таблица более 300 моделей переоценивает каждую модель по вашему фактическому набору токенов. Пятнадцать минут в квартал обычно позволяют сэкономить 30–60 % за счет переключения на один уровень рабочей нагрузки вниз. Калькулятор экономии при снижении цен цены ровно столько, сколько стоит миграция.
Маршрут по сложности. 100-кратный разброс между ценами на сырьевые товары и граничными ценами — это возможность: большинство производственных запросов не нуждаются в граничных ценах. калькулятор маршрутизации модели показывает математические расчеты смешанных затрат.