HomeBlog › Custo de raciocínio DeepSeek R1 vs o1 vs o3

DeepSeek R1 vs o1 vs o3: o prêmio de raciocínio não diminuiu uniformemente

Publicado em 10/08/2026 · números de referência, verifique antes de orçamentar

Execute a mesma carga de trabalho de cadeia de pensamento por meio do o1 da OpenAI e custa 27 vezes o que custa o DeepSeek R1. Em vez disso, execute-o por meio de o3 – mesmo provedor, mesmo nível de raciocínio, mesmo comportamento de “pensar antes de responder” – e a diferença cai para 3,6 vezes. Essa não é uma diferença de arredondamento. Isso significa que a pergunta “quanto custa um modelo de raciocínio em relação a um modelo aberto” não tem uma resposta. Ele tem uma resposta diferente para cada modelo enviado pela OpenAI, porque a linha de raciocínio da própria OpenAI abrange uma faixa de 7,5x antes mesmo de você olhar fora de seu catálogo.

A escalação, lado a lado

Extraído diretamente de nossa tabela de preços (387 modelos rastreados, atualizados pela última vez em relação aos documentos do fornecedor): os quatro SKUs de raciocínio atuais da OpenAI, mais o R1 da DeepSeek e suas variantes destiladas, por 1 milhão de tokens.

ModeloProvedorEntrada /1MSaída /1Mvs DeepSeek R1 (combinado)
o1OpenAI$15.00$60.0027.4×
o3OpenAI$2.00$8.003.7×
o4-mini / o3-mini / o1-miniOpenAI$1.10$4.402.0×
Grok 4 RaciocínioxAI$3.00$15.006.2×
DeepSeekR1DeepSeek$0.55$2.191.0×
DeepSeek R1 Destilar Lhama 70BDeepSeek$0.23$0.690.35×
DeepSeek R1 Destilar Qwen 32BDeepSeek$0.18$0.180.11×
Preços de referência da nossa tabela rastreada, 387 modelos. "vs DeepSeek R1" usa uma proporção combinada de token de entrada: saída de 3:8 que corresponde ao exemplo trabalhado abaixo. Execute sua própria proporção no calculadora de custo de tokens de raciocínio.

Observe a forma dessa curva. Não é uma linha reta do caro ao barato – o1 para o3 por si só representa uma redução de 87% no preço de produção dentro do próprio catálogo da OpenAI, sem nenhum concorrente envolvido. As variantes destiladas do DeepSeek reduziram até mesmo o R1 completo em mais 3-5x, a um custo de capacidade real sobre o qual os benchmarks são honestos. Quatro pontos numa mesa, quatro histórias completamente diferentes sobre o que significa “a taxa de raciocínio”.

Um exemplo funcional: 10.000 solicitações por mês

Um agente de triagem de suporte que raciocina antes de responder: 1.500 tokens de entrada de contexto por ticket, 4.000 tokens de saída depois de contar os tokens ocultos da cadeia de pensamento cobrados como saída. 10.000 tickets por mês equivalem a 15 milhões de tokens de entrada e 40 milhões de tokens de saída, executados em cada modelo:

ModeloCusto de entradaCusto de produçãoTotal mensal
o1$225.00$2,400.00$2,625.00
Grok 4 Raciocínio$45.00$600.00$645.00
o3$30.00$320.00$350.00
o4-mini$16.50$176.00$192.50
DeepSeekR1$8.25$87.60$95.85
10.000 ingressos/mês × 1.500 entradas/4.000 tokens de saída. Carga de trabalho ilustrativa – avalie seu próprio mix no calculadora de custo de tokens de raciocínio.

US$ 2.625 por mês no o1 contra US$ 95,85 no DeepSeek R1 para uma carga de trabalho que, no papel, exige a mesma coisa de ambos os modelos. Troque o1 por o3 e a conta do OpenAI sozinha cai 87%, de US$ 2.625 para US$ 350 – antes que o DeepSeek entre na comparação. A maioria das histórias de terror sobre o “imposto de raciocínio” que circulam atualmente são, na verdade, preços de o1, herdados de quando eram a única opção de raciocínio de fronteira. Não é mais, mesmo dentro da própria programação da OpenAI.

Por que a diferença não é a mesma em todos os lugares

o1 foi cotado quando a inferência de raciocínio era escassa e em grande parte não comprovada – ele foi vendido quase no topo de todo o catálogo da OpenAI, com raciocínio ou não. o3 e o4-mini vieram depois da concorrência (DeepSeek R1 lançado em janeiro, seguido pelos níveis de raciocínio de Grok e Gemini) forçaram os laboratórios de fronteira a defender os preços de raciocínio da mesma forma que já haviam sido forçados a defender os principais preços de chat. Os modelos de raciocínio de minicamada, em particular, agora estão próximos o suficiente dos preços de nível intermediário sem raciocínio, de modo que "devo usar um modelo de raciocínio" deixou de ser principalmente uma questão de custo para muitas cargas de trabalho - em vez disso, é uma questão de latência e cadeia de orçamento de token de pensamento.

O que não convergiu foi a qualidade por dólar no topo. o1 e o3 não são intercambiáveis ​​– o3 é o modelo mais novo e geralmente mais forte por uma fração do preço, o que é uma atualização simples. DeepSeek R1 é uma compensação diferente: pesos abertos, auto-hospedados e com preços semelhantes, mas comparados significativamente atrás do o3 em tarefas de raciocínio difíceis na maioria das avaliações de terceiros que vimos citadas. O número 27x contra o1 é real e vale a pena conhecer. Não é a mesma afirmação que “R1 substitui o3 por 27x menos” – essa comparação está mais próxima de 3,7x e é uma compensação de capacidade, não uma atualização gratuita.

A regra de decisão

Não se ancore no preço do o1 - é o SKU de raciocínio mais caro do mercado por uma ampla margem e cada vez mais não é aquele contra o qual as equipes deveriam definir preços. Ancore em o3 ou o4-mini como a linha de base realista do OpenAI e, em seguida, decida se o desconto restante de 2 a 4x do DeepSeek R1 vale a pena a sobrecarga de auto-hospedagem ou inferência de terceiros e se a queda de capacidade das variantes destiladas é aceitável para sua tarefa. Defina o preço de sua combinação real de tokens – as cargas de trabalho de raciocínio distorcem a produção pesada de uma forma que as cargas de trabalho de chat não fazem, portanto, a proporção combinada é mais importante aqui do que em qualquer outro lugar na pilha de custos da API. Execute os números no calculadora de custo de tokens de raciocínio ou o calculadora de saturação de token de raciocínio se os tokens ocultos da cadeia de pensamento são a parte que você não pode prever e veja o imposto do token de raciocínio para saber como o3 se compara ao GPT-4.1 sem raciocínio no mesmo prompt.

Metodologia: preços de nossa tabela de preços rastreados (387 modelos) em agosto de 2026, correspondendo às taxas publicadas por 1 milhão de token de cada provedor. O exemplo resolvido usa uma proporção de tokens construída de 1.500 entradas/4.000 saídas para ilustrar o dimensionamento, não a telemetria de um sistema de produção — confirme o mix de tokens da sua própria carga de trabalho e a taxa atual de cada fornecedor antes de orçamentar.