Опубликовано 30 июля 2026 г. · справочные цены, проверьте перед составлением бюджета
Откройте прайс-лист, и o3 и GPT-4.1 выглядят одинаково: вход 2 доллара США, выход 8 долларов США за миллион токенов. Поэтому я выполнил одно и то же задание по извлечению данных для обоих, ожидая одного и того же счета. о3 вернулся в 4,3 раза дороже. Тот же ввод, тот же видимый ответ, та же ставка за токен. Разрыв — это позиция, которую большинство людей никогда не видит на странице цен: токены рассуждения.
Модели рассуждения (O1, o3, o4-mini OpenAI и режимы рассуждения GPT-5) не сразу дают ответ. Сначала они генерируют частную цепочку мыслей, а затем короткий видимый ответ. Вы никогда не видите цепочку, но вы платите за каждый ее жетон, в выход ставка. В задаче, где модель возвращает 400 видимых жетонов, она может незаметно сжечь еще 2000 жетонов рассуждений. Ваш счет рассчитывается на основе 2400 токенов вывода, а не 400.
Вот и вся хитрость. Цена наклейки честная; он просто описывает цену токенов, а модели рассуждения выдают гораздо больше дорогих токенов.
| Модель | Вход | Выход | Тип |
|---|---|---|---|
| ГПТ-4.1 | $2.00 | $8.00 | Стандартный |
| о3 | $2.00 | $8.00 | Рассуждение |
| о4-мини дешевле | $1.10 | $4.40 | Рассуждение |
| о1 | $15.00 | $60.00 | Рассуждение |
| ГПТ-5 | $1.25 | $10.00 | Гибридный |
Возьмем реальную рабочую нагрузку: 1000 запросов/день, каждые 800 входных токенов и 400 видимых выходных токенов. Запустите его на месяц (30 тысяч запросов, 24 миллиона входных токенов, 12 миллионов видимых выходных токенов). Теперь добавьте скрытую часть. В моих собственных забегах серии О мне приходится решать задачу умеренной сложности. 1500–2500 жетонов рассуждений; Здесь я буду использовать 2000, что добавляет 60 миллионов оплачиваемых выходных токенов поверх видимых 12 миллионов.
| Модель | Токены рассуждения/требования | Стоимость / месяц |
|---|---|---|
| GPT-4.1 (без обоснования) | 0 | $144 |
| о4-мини | ~2000 | $343 |
| о3 | ~2000 | $624 |
GPT-4.1 и o3 имеют общий прайс-лист, но счета o3 624 доллара против 144 долларов — потому что 72 миллиона выходных токенов (12 миллионов видимых + 60 миллионов рассуждений) проходят через счетчик стоимостью 8 долларов вместо 12 миллионов. o4-mini — это разумная середина: дешевле за токен, при этом по-прежнему платится налог на рассуждения, поэтому его стоимость составляет 343 доллара — более чем вдвое больше, чем модель без рассуждений, выполняющая ту же видимую работу.
OpenAI представляет reasoning_effort параметр (минимальный/низкий/средний/высокий). Это самая большая ручка в этом законопроекте, и большая часть кода оставляет ее по умолчанию. Уменьшите o3 с ~2000 жетонов рассуждений до ~400, и в том же месяце От 624 до 240 долларов. Та же модель, та же задача, один параметр — сокращение на 62%. Для всего, что не является по-настоящему сложной многоэтапной задачей, низкие или минимальные усилия обычно проходят проверку и незаметно удаляют большую часть налога.
1. Не прибегайте к модели рассуждения рефлекторно. Извлечение, классификация, маркировка, маршрутизация и краткие сводки не требуют цепочки мыслей. Стандартная модель по той же цене стоит на четверть дороже, поскольку не излучает жетоны рассуждения.
2. Если мне нужны рассуждения, я ставлю reasoning_effort явно и начните с низкого уровня, увеличивая его только тогда, когда оценка доказывает, что качество ответа падает.
3. Я прочитал completion_tokens_details поле. Ответ API разделяется reasoning_tokens отдельно — вот откуда утекают деньги, и это незаметно в ментальной модели каждого запроса «он вернул 400 токенов».
4. Маршрутизирую. Cheap task → standard small model. Hard task → reasoning model at measured effort. A simple router pays for itself in days; see the numbers in the LLM cascade savings calculator.
Хотите точное количество ваших токенов? Поместите свой вклад, видимый результат и реалистичную оценку маркеров рассуждения в Калькулятор стоимости AI API →или сравните поставщиков друг с другом в калькулятор стоимости чат-бота. Новое в ценообразовании токенов? Начать с Узнайте: как работает ценообразование API.
Справочные оценки, июль 2026 г. Число логических токенов зависит от рабочей нагрузки и берется из наших собственных расчетов, а не из данных поставщиков — измеряйте свои. Не связан с OpenAI.