HomeBlog › Стоимость рассуждений DeepSeek R1, o1 и o3

DeepSeek R1 против o1 против o3: премия за рассуждение сокращалась неравномерно

Опубликовано 10 августа 2026 г. · справочные номера, проверьте перед составлением бюджета

Запустите ту же рабочую нагрузку с помощью o1 OpenAI, и это будет стоить в 27 раз больше, чем стоит DeepSeek R1. Вместо этого запустите его через o3 — тот же поставщик, тот же уровень рассуждений, то же поведение «думать, прежде чем ответить» — и разрыв уменьшится до 3,6 раза. Это не разница округлений. Это означает, что вопрос «насколько модель рассуждения стоит лучше модели открытого веса» не имеет одного ответа. У него есть свой ответ для каждой модели, поставляемой OpenAI, потому что собственная линейка рассуждений OpenAI охватывает диапазон 7,5x, прежде чем вы даже посмотрите за пределы их каталога.

Состав, бок о бок

Получено прямо из нашей таблицы цен (отслеживается 387 моделей, последнее обновление согласно документации поставщика): четыре текущих SKU рассуждений OpenAI, а также R1 DeepSeek и его дистиллированные варианты, за 1 миллион токенов.

МодельПоставщикВход /1МВыход /1Мпротив DeepSeek R1 (смешанный)
о1ОпенАИ$15.00$60.0027.4×
о3ОпенАИ$2.00$8.003.7×
о4-мини / о3-мини / о1-миниОпенАИ$1.10$4.402.0×
Грок 4 РассуждениеxAI$3.00$15.006.2×
ДипСик Р1ДипСик$0.55$2.191.0×
DeepSeek R1 Дистилл Лама 70BДипСик$0.23$0.690.35×
DeepSeek R1 Дистилл Qwen 32BДипСик$0.18$0.180.11×
Справочные цены из нашей отслеживаемой таблицы, 387 моделей. «Vs DeepSeek R1» использует смешанное соотношение входных и выходных токенов 3:8, что соответствует рабочему примеру ниже. Запустите собственное соотношение на Калькулятор стоимости жетонов рассуждений.

Обратите внимание на форму этой кривой. Это не прямая линия от дорогого к дешевому — только от o1 до o3 снижение цен на продукцию в собственном каталоге OpenAI составляет 87%, без участия конкурентов. Дистиллированные варианты DeepSeek затем подрывают даже полный R1 еще в 3-5 раз, при реальной стоимости производительности, о которой честны тесты. Четыре пункта в одной таблице, четыре совершенно разные истории о том, что такое «налог на рассуждения».

Один рабочий пример: 10 000 запросов в месяц.

Агент сортировки поддержки, который рассуждает, прежде чем ответить: 1500 входных токенов контекста на каждый билет, 4000 выходных токенов, как только вы подсчитаете скрытые токены цепочки мыслей, оплачиваемые как выходные. 10 000 билетов в месяц — это 15 миллионов входных жетонов и 40 миллионов выходных токенов для каждой модели:

МодельВходная стоимостьВыходная стоимостьИтого за месяц
о1$225.00$2,400.00$2,625.00
Грок 4 Рассуждение$45.00$600.00$645.00
о3$30.00$320.00$350.00
о4-мини$16.50$176.00$192.50
ДипСик Р1$8.25$87.60$95.85
10 000 билетов в месяц × 1 500 входных/4 000 выходных жетонов. Иллюстративная рабочая нагрузка — оцените свой собственный микс на Калькулятор стоимости жетонов рассуждений.

2625 долларов в месяц за o1 против 95,85 долларов за DeepSeek R1 за рабочую нагрузку, которая на бумаге требует одного и того же от обеих моделей. Вместо этого замените o1 на o3, и только стоимость OpenAI упадет на 87%, с $2625 до $350 — еще до того, как DeepSeek вообще войдет в сравнение. Большинство ужасных историй о «налоге на рассуждения», циркулирующих сейчас, на самом деле представляют собой ценообразование o1, перенесенное с тех времен, когда оно было единственным вариантом рассуждения. Этого уже нет, даже внутри собственной линейки OpenAI.

Почему разрыв не везде одинаков

o1 ценился, когда логический вывод был скудным и в основном недоказанным — он поставлялся в верхней части всего каталога OpenAI, независимо от того, аргументирован он или нет. o3 и o4-mini появились после того, как конкуренция (DeepSeek R1 была запущена в январе, за ней последовали уровни рассуждений Grok и Gemini) вынудила пограничные лаборатории защищать ценообразование так же, как они уже были вынуждены защищать цены на флагманские чаты. В частности, модели мини-уровня рассуждения теперь достаточно близки к необоснованному ценообразованию среднего уровня, и вопрос «стоит ли мне использовать модель рассуждения» перестал быть в первую очередь вопросом стоимости для многих рабочих нагрузок — вместо этого это вопрос о задержке и цепочке размышлений о бюджете токенов.

Что не совпало, так это качество на доллар на самом верху. o1 и o3 не взаимозаменяемы: o3 – это более новая и, как правило, более мощная модель за небольшую цену, что представляет собой простое обновление. DeepSeek R1 — это другой компромисс: открытые веса, самостоятельное размещение и такая же цена, но он значительно уступает o3 в сложных логических задачах в большинстве сторонних оценок, которые мы видели. Число 27x против o1 реально и его стоит знать. Это не то же самое, что «R1 заменяет o3 в 27 раз меньше» — это сравнение ближе к 3,7 раза, и это компромисс возможностей, а не бесплатное обновление.

Правило принятия решения

Не зацикливайтесь на цене o1 — это самый дорогой SKU на рынке с большим отрывом, и команды все чаще не должны сравнивать его с ценами. Остановитесь на o3 или o4-mini как на реалистичном базовом уровне OpenAI, а затем решите, стоит ли оставшаяся 2-4-кратная скидка DeepSeek R1 накладных расходов на самостоятельный хостинг или сторонний вывод, и приемлемо ли снижение возможностей дистиллированных вариантов для вашей задачи. Оцените фактическую смесь токенов — рабочие нагрузки рассуждения искажают объем вывода в отличие от рабочих нагрузок чата, поэтому смешанное соотношение здесь имеет большее значение, чем где-либо еще в стеке затрат API. Проведите числа на Калькулятор стоимости жетонов рассуждений или Калькулятор переполнения жетонов рассуждений если скрытые жетоны цепочки мыслей — это та часть, которую вы не можете предсказать, и посмотрите налог на аргументы о том, как o3 сравнивается с GPT-4.1 без рассуждений в той же подсказке.

Методология: цены из нашей отслеживаемой таблицы цен (387 моделей) по состоянию на август 2026 года, соответствующие опубликованным ставкам каждого поставщика за 1 миллион токенов. В проработанном примере используется построенное соотношение токенов 1500 входов и 4000 выходов для иллюстрации масштабирования, а не телеметрии из производственной системы — подтвердите набор токенов вашей собственной рабочей нагрузки и текущую ставку каждого поставщика перед составлением бюджета.