Published 2026-08-12 · reference numbers, verify before budgeting
Run the same content-moderation job — 150 input tokens of context, a 5-token label out the other end — through nine different "cheap" models and the monthly bill lands anywhere from $59.50 to $1,750. Same job, same volume, same output. A 29x spread, and every one of these nine models gets pitched to you as "the budget option" depending on which vendor's docs you're reading.
Extraído de nossa tabela de preços rastreados (387 modelos): cada modelo com preço inferior a US$ 1/1 milhão de tokens de entrada que um provedor comercializa atualmente para tarefas de alto volume e baixa latência – classificação, extração, moderação, roteamento. 10 milhões de chamadas por mês, 150 tokens de entrada e 5 tokens de saída cada, totalizando 1,5 bilhão de tokens de entrada e 50 milhões de tokens de saída.
| Modelo | Provedor | Entrada /1M | Saída /1M | Monthly (10M calls) |
|---|---|---|---|---|
| Nova Micro | Amazônia | $0.035 | $0.14 | $59.50 |
| Ministral 3B | Mistral | $0.040 | $0.04 | $62.00 |
| Comando R7B | Coerente | $0.0375 | $0.15 | $63.75 |
| Gêmeos 3.1 Flash-Lite | $0.050 | $0.20 | $85.00 | |
| GPT-5 nano | OpenAI | $0.100 | $0.40 | $170.00 |
| GPT-4.1 nano | OpenAI | $0.100 | $0.40 | $170.00 |
| GPT-4o mini | OpenAI | $0.150 | $0.60 | $255.00 |
| Claude Haiku 3.5 | Antrópico | $0.800 | $4.00 | $1,400.00 |
| Claude Haiku 4.5 | Antrópico | $1.000 | $5.00 | $1,750.00 |
| Reference pricing from our tracked table, 387 models. Worked example: 10M calls/mo × 150 input + 5 output tokens. Price your own volume on the classification cost calculator. | ||||
Nova Micro, Ministral 3B and Command R7B are within 7% of each other and none of them are the household names in this list. The two OpenAI nano SKUs sit at almost 3x Nova Micro. GPT-4o mini — probably the most-reached-for "cheap" model by brand recognition alone — is already 4.3x Nova Micro. And Claude's Haiku line, marketed as Anthropic's budget tier, is priced closer to some mid-tier chat models than to anything else on this table: 29.4x Nova Micro on input, 35.7x on output.
Every provider ships a cheap model because every provider needs an answer to "what do I run at a billion calls a month." But cheap is relative to each vendor's own flagship, not to the market. Anthropic's flagship-to-Haiku gap and Amazon's flagship-to-Nova-Micro gap are both real discounts within their own catalogs — they just don't start from the same place. Nova Micro was built by a cloud provider that also sells the compute underneath it, so the model can be priced closer to marginal cost. Claude Haiku inherits pricing gravity from being positioned next to Sonnet and Opus, where "10x cheaper than our flagship" still lands at $1/1M because the flagship itself is expensive.
Nada disso significa que o Haiku é um modelo ruim para um trabalho de classificação - frequentemente é o mais preciso, e vale a pena pagar pela precisão quando um rótulo errado custa mais do que a diferença simbólica. Isso significa que “nível de orçamento” é uma afirmação sobre a linha do próprio fornecedor, não uma afirmação sobre o mercado, e as duas são constantemente confundidas nas páginas de preços e nos tópicos de comparação.
Para uma tarefa genuinamente de alto volume e baixa complexidade – filtragem de spam, roteamento de intenções, detecção de PII, marcação de sentimento – comece com Nova Micro, Ministral 3B ou Command R7B como preço mínimo, e não com qualquer marca para a qual você já tenha uma chave de API. Execute uma verificação real de precisão em seus dados rotulados antes de confirmar; uma diferença de preço de 29x só é uma boa negociação se a taxa de erro do modelo barato não consumir a economia no custo posterior (tíquetes mal roteados, sinalizadores de moderação perdidos, extrações ruins que precisam de revisão humana). Se a precisão em sua tarefa específica não for inferior a GPT-4o mini ou Haiku, esse é o preço real da tarefa – não US$ 59,50 e nem US$ 1.750 por padrão. Defina o preço de seu próprio mix e volume de tokens no calculadora de custos de classificação ou o calculadora de custos de moderação de conteúdoe compare escalações completas no página API LLM mais barata.
Metodologia: preços de nossa tabela de preços rastreados (387 modelos) em agosto de 2026, correspondendo às taxas publicadas por 1 milhão de token de cada provedor. O exemplo resolvido usa uma proporção de tokens construída de 150 entradas/5 saídas, típica de chamadas de classificação curtas, e não telemetria de um sistema de produção — confirme o mix de tokens da sua própria carga de trabalho e a taxa atual de cada provedor antes de orçamentar.