Publicado em 10/08/2026 · números de referência, verifique antes de orçamentar
Execute a mesma carga de trabalho de cadeia de pensamento por meio do o1 da OpenAI e custa 27 vezes o que custa o DeepSeek R1. Em vez disso, execute-o por meio de o3 – mesmo provedor, mesmo nível de raciocínio, mesmo comportamento de “pensar antes de responder” – e a diferença cai para 3,6 vezes. Essa não é uma diferença de arredondamento. Isso significa que a pergunta “quanto custa um modelo de raciocínio em relação a um modelo aberto” não tem uma resposta. Ele tem uma resposta diferente para cada modelo enviado pela OpenAI, porque a linha de raciocínio da própria OpenAI abrange uma faixa de 7,5x antes mesmo de você olhar fora de seu catálogo.
Extraído diretamente de nossa tabela de preços (387 modelos rastreados, atualizados pela última vez em relação aos documentos do fornecedor): os quatro SKUs de raciocínio atuais da OpenAI, mais o R1 da DeepSeek e suas variantes destiladas, por 1 milhão de tokens.
| Modelo | Provedor | Entrada /1M | Saída /1M | vs DeepSeek R1 (combinado) |
|---|---|---|---|---|
| o1 | OpenAI | $15.00 | $60.00 | 27.4× |
| o3 | OpenAI | $2.00 | $8.00 | 3.7× |
| o4-mini / o3-mini / o1-mini | OpenAI | $1.10 | $4.40 | 2.0× |
| Grok 4 Raciocínio | xAI | $3.00 | $15.00 | 6.2× |
| DeepSeekR1 | DeepSeek | $0.55 | $2.19 | 1.0× |
| DeepSeek R1 Destilar Lhama 70B | DeepSeek | $0.23 | $0.69 | 0.35× |
| DeepSeek R1 Destilar Qwen 32B | DeepSeek | $0.18 | $0.18 | 0.11× |
| Preços de referência da nossa tabela rastreada, 387 modelos. "vs DeepSeek R1" usa uma proporção combinada de token de entrada: saída de 3:8 que corresponde ao exemplo trabalhado abaixo. Execute sua própria proporção no calculadora de custo de tokens de raciocínio. | ||||
Observe a forma dessa curva. Não é uma linha reta do caro ao barato – o1 para o3 por si só representa uma redução de 87% no preço de produção dentro do próprio catálogo da OpenAI, sem nenhum concorrente envolvido. As variantes destiladas do DeepSeek reduziram até mesmo o R1 completo em mais 3-5x, a um custo de capacidade real sobre o qual os benchmarks são honestos. Quatro pontos numa mesa, quatro histórias completamente diferentes sobre o que significa “a taxa de raciocínio”.
Um agente de triagem de suporte que raciocina antes de responder: 1.500 tokens de entrada de contexto por ticket, 4.000 tokens de saída depois de contar os tokens ocultos da cadeia de pensamento cobrados como saída. 10.000 tickets por mês equivalem a 15 milhões de tokens de entrada e 40 milhões de tokens de saída, executados em cada modelo:
| Modelo | Custo de entrada | Custo de produção | Total mensal |
|---|---|---|---|
| o1 | $225.00 | $2,400.00 | $2,625.00 |
| Grok 4 Raciocínio | $45.00 | $600.00 | $645.00 |
| o3 | $30.00 | $320.00 | $350.00 |
| o4-mini | $16.50 | $176.00 | $192.50 |
| DeepSeekR1 | $8.25 | $87.60 | $95.85 |
| 10.000 ingressos/mês × 1.500 entradas/4.000 tokens de saída. Carga de trabalho ilustrativa – avalie seu próprio mix no calculadora de custo de tokens de raciocínio. | |||
US$ 2.625 por mês no o1 contra US$ 95,85 no DeepSeek R1 para uma carga de trabalho que, no papel, exige a mesma coisa de ambos os modelos. Troque o1 por o3 e a conta do OpenAI sozinha cai 87%, de US$ 2.625 para US$ 350 – antes que o DeepSeek entre na comparação. A maioria das histórias de terror sobre o “imposto de raciocínio” que circulam atualmente são, na verdade, preços de o1, herdados de quando eram a única opção de raciocínio de fronteira. Não é mais, mesmo dentro da própria programação da OpenAI.
o1 foi cotado quando a inferência de raciocínio era escassa e em grande parte não comprovada – ele foi vendido quase no topo de todo o catálogo da OpenAI, com raciocínio ou não. o3 e o4-mini vieram depois da concorrência (DeepSeek R1 lançado em janeiro, seguido pelos níveis de raciocínio de Grok e Gemini) forçaram os laboratórios de fronteira a defender os preços de raciocínio da mesma forma que já haviam sido forçados a defender os principais preços de chat. Os modelos de raciocínio de minicamada, em particular, agora estão próximos o suficiente dos preços de nível intermediário sem raciocínio, de modo que "devo usar um modelo de raciocínio" deixou de ser principalmente uma questão de custo para muitas cargas de trabalho - em vez disso, é uma questão de latência e cadeia de orçamento de token de pensamento.
O que não convergiu foi a qualidade por dólar no topo. o1 e o3 não são intercambiáveis – o3 é o modelo mais novo e geralmente mais forte por uma fração do preço, o que é uma atualização simples. DeepSeek R1 é uma compensação diferente: pesos abertos, auto-hospedados e com preços semelhantes, mas comparados significativamente atrás do o3 em tarefas de raciocínio difíceis na maioria das avaliações de terceiros que vimos citadas. O número 27x contra o1 é real e vale a pena conhecer. Não é a mesma afirmação que “R1 substitui o3 por 27x menos” – essa comparação está mais próxima de 3,7x e é uma compensação de capacidade, não uma atualização gratuita.
Não se ancore no preço do o1 - é o SKU de raciocínio mais caro do mercado por uma ampla margem e cada vez mais não é aquele contra o qual as equipes deveriam definir preços. Ancore em o3 ou o4-mini como a linha de base realista do OpenAI e, em seguida, decida se o desconto restante de 2 a 4x do DeepSeek R1 vale a pena a sobrecarga de auto-hospedagem ou inferência de terceiros e se a queda de capacidade das variantes destiladas é aceitável para sua tarefa. Defina o preço de sua combinação real de tokens – as cargas de trabalho de raciocínio distorcem a produção pesada de uma forma que as cargas de trabalho de chat não fazem, portanto, a proporção combinada é mais importante aqui do que em qualquer outro lugar na pilha de custos da API. Execute os números no calculadora de custo de tokens de raciocínio ou o calculadora de saturação de token de raciocínio se os tokens ocultos da cadeia de pensamento são a parte que você não pode prever e veja o imposto do token de raciocínio para saber como o3 se compara ao GPT-4.1 sem raciocínio no mesmo prompt.
Metodologia: preços de nossa tabela de preços rastreados (387 modelos) em agosto de 2026, correspondendo às taxas publicadas por 1 milhão de token de cada provedor. O exemplo resolvido usa uma proporção de tokens construída de 1.500 entradas/4.000 saídas para ilustrar o dimensionamento, não a telemetria de um sistema de produção — confirme o mix de tokens da sua própria carga de trabalho e a taxa atual de cada fornecedor antes de orçamentar.