Опубликовано 2 августа 2026 г. · справочные цены из нашего реестра 387 моделей. Проверьте перед составлением бюджета.
«Просто используйте маленькую модель» — это стандартный совет по снижению затрат. Наконец я правильно оценил его по всему нашему реестру моделей, и этот совет сам по себе оказался почти бессмысленным. Понижение одного уровня в линейке Anthropic спасет вас. 40%. Точно такой же ход в линейке сохранений Google 96%. То же решение, тот же объем инженерной работы, совершенно разная отдача — потому что разрыв между флагманом производителя и его дешевым уровнем не является постоянным. Оно варьируется от 1,7× до 24×.
Один месяц, 200 миллионов входных токенов и 40 миллионов выходных токенов. Это примерно 250 000 запросов при 800 входных и 160 токенах — реальный продукт, выполняющий классификацию, сводки и короткие ответы в чате. Никакого кэширования, никаких пакетных скидок, поэтому цифры остаются сопоставимыми. Все приведенные ниже цены взяты из нашего отслеживаемого реестра (387 моделей, справочные цены на июль – август 2026 г.).
| Семья | Уровень | $/1 млн в | Выход $/1 миллион | Месяц |
|---|---|---|---|---|
| ОпенАИ | ГПТ-5,5 | $5.00 | $30.00 | $2,200 |
| ГПТ-5 | $1.25 | $10.00 | $650 | |
| ГПТ-5 мини | $0.40 | $1.60 | $144 | |
| ГПТ-5 нано самый дешевый | $0.10 | $0.40 | $36 | |
| антропный | Клод Опус 4.8 | $5.00 | $25.00 | $2,000 |
| Клод Сонет 4.6 | $3.00 | $15.00 | $1,200 | |
| Клод Хайку 4.5 | $1.00 | $5.00 | $400 | |
| Близнецы 3.1 Про | $2.00 | $12.00 | $880 | |
| Близнецы 3.1 Флэш | $0.10 | $0.40 | $36 | |
| Близнецы 3.1 Флэш-Лайт | $0.05 | $0.20 | $18 | |
| xAI | Грок 4 | $3.00 | $15.00 | $1,200 |
| Грок 4 мини | $0.50 | $2.50 | $200 | |
| ДипСик | ДипСик V4 | $0.27 | $1.10 | $98 |
| DeepSeek V4 Флэш-память | $0.14 | $0.28 | $39 | |
| Мистраль | Мистраль Большой | $2.00 | $6.00 | $640 |
| Мистраль Малый | $0.10 | $0.30 | $32 |
Удалите все, кроме хода, который на самом деле рассматривает большинство команд — флагмана на уровень, расположенный непосредственно под ним:
| Двигаться | До → после | Сохранено |
|---|---|---|
| Опус 4.8 → Сонет 4.6 | 2000 долларов США → 1200 долларов США | 40% |
| DeepSeek V4 → V4 Флэш | 98 долларов США → 39 долларов США | 60% |
| ГПТ-5,5 → ГПТ-5 | 2200 долларов США → 650 долларов США | 70% |
| Грок 4 → Грок 4 мини | 1200 долларов США → 200 долларов США | 83% |
| Мистраль Большой → Маленький | 640 долларов США → 32 доллара США | 95% |
| Близнецы 3.1 Pro → Прошивка | 880 долларов США → 36 долларов США | 96% |
Сорок процентов против девяноста шести процентов. Оба «используют меньшую модель». Один из них требует спринта работы по оценке и уровня маршрутизации; другой стоит в лучшем случае дня, потому что вы потратите больше инженерных часов, чтобы доказать, что Sonnet достаточно хорош, чем сэкономленные 800 долларов.
Это не значит, что Anthropic скупится на скидки. Наоборот: их флагман резко подешевел. Claude Opus 4.1 находится в нашем реестре по адресу $15/$75. Опус 4.5, 4.6 и 4.8 все сидят на месте. $5/$25 — сокращение верхней части линейки в 3 раза без изменения цены Sonnet или Haiku. За мой месяц с 240 миллионами токенов Opus вырос с 6000 до 2000 долларов.
Побочный эффект: разрыв между опусом и сонетом сократился с 5× до 1,67×. Пограничный налог в Anthropic практически прекратил свое существование. OpenAI сделал то же самое, но по другой оси: o1 по цене 15/60 долларов был заменен на GPT-5 по цене 1,25/10 долларов, поэтому позиция дорогой пограничной модели, которую люди планировали в бюджете на 2025 год, теперь имеет другой порядок величины.
Google пошел другим путем. Они сохранили разумную цену Pro на уровне 2/12 долларов США и снизили цену Flash-Lite до 0,05/0,20 доллара, так что их внутренний спред теперь самый широкий среди всех крупных семейств. В этом нет ничего случайного — это маршрутный шаг.
Стоимость флэш-памяти Gemini 3.1 $36 при этой нагрузке. DeepSeek V4, который я мысленно назвал «дешевым вариантом», стоит $98 — почти в 3 раза больше. А GPT-5,5 за 2200 долларов стоит В 122 раза дороже Gemini 3.1 Flash-Lite по цене $18 за перемещение того же объема токенов.
У меня был мысленный ценовой рейтинг двухлетней давности. Это было неправильно в обоих направлениях. Репутация дешевого продавца отстает от фактических цен примерно на год, и цифры меняются быстрее, чем фольклор.
1. Я проверяю зазор между уровнями перед сборкой маршрутизатора. Если соотношение «флагман-мини» меньше 2×, каскад не стоит ни сложности, ни бюджета оценки — я беру флагман и вместо этого трачу усилия на оперативное кэширование, что сокращает еще больше.
2. Если разрыв составляет 20×, я маршрутизирую агрессивно. Дешевый уровень обеспечивает классификацию, извлечение, маркировку и маршрутизацию. Флагман видит только то, что не проходит проверку достоверности. Что касается спреда Google, который превращает 880 долларов в нечто близкое к 60 долларам с коэффициентом эскалации 10%, арифметика находится в Калькулятор каскадной экономии LLM и Калькулятор экономии на маршрутизации модели.
3. Я пересматриваю цены на всю линейку каждый квартал. Переоценка Opus изменила то, какие оптимизации стоит делать, и я узнал об этом с опозданием на несколько недель. Вот что трекер изменения цен это на данный момент.
4. Я никогда не сравниваю только стоимость исходных материалов. В среднем на 97 проверенных мной моделях чата выходной сигнал в 4 раза превышает ввод, а в GPT-5.5 и Gemini 3.1 Pro — в 6 раз. Болтливая модель с низкой ставкой ввода проигрывает краткой модели с дорогой ставкой чаще, чем люди ожидают. Если ваше приложение меняет модели, стоимость миграции также имеет значение — см. Калькулятор стоимости миграции модели.
Поместите свой собственный токен в Калькулятор стоимости AI API →или смоделируйте полный продукт в Оценщик стоимости приложения с искусственным интеллектом и калькулятор стоимости чат-бота. Новое в ценообразовании токенов? Начать с Узнайте: как работает ценообразование API.
Справочные оценки по состоянию на август 2026 г. взяты из нашего реестра отслеживаемых моделей. Цены изменяются без предварительного уведомления и исключают скидки на кэширование, пакетные и объемные скидки — уточните у поставщика, прежде чем выделять бюджет. Не связан с OpenAI, Anthropic, Google, xAI, DeepSeek или Mistral.