0 modelos comparados · clique no cabeçalho de uma coluna para classificar
| Modelo ▲▼ | Provedor ▲▼ | Entrada $/1 milhão ▲▼ | Saída $/1 milhão ▲▼ | Misturado 3:1 ▲▼ | Contexto ▲▼ | Seu $/ mês ▲▼ |
|---|
Por que uma comparação justa de preços de IA precisa de dois números
Quase todas as tabelas de “preços de modelo de IA” que você encontrará on-line são classificadas por preço de entrada, porque é o número menor e mais fácil de imprimir. Mas aplicações reais são cobradas ambos direções, e os tokens de saída têm preços rotineiramente duas a seis vezes mais altos do que os de entrada. Um aplicativo de recuperação ou resumo que lê documentos longos e escreve respostas curtas exige muita entrada; um chatbot, agente ou gerador de código que produz conclusões longas tem muitos resultados. Os mesmos dois modelos podem trocar de lugar na classificação apenas com base na direção do seu tráfego. É por isso que esta tabela mostra a entrada e a saída separadamente, adiciona um linha de base combinada 3:1 (uma proporção comum no mundo real de três tokens de entrada por token de saída) para classificação rápida entre maçãs e permite inserir seus próprios volumes para calcular a conta que você realmente pagaria.
Como ler a tabela
Digite na caixa de pesquisa para ir para um modelo ou fornecedor, ou clique nos ícones de fornecedor e categoria para restringir o campo – carro-chefe, médio, orçamento, raciocínio, incorporação, visão ou peso aberto. Clique em qualquer cabeçalho de coluna para classificar em ordem crescente e clique novamente para reverter. O Seu $/mês A coluna recalcula instantaneamente a partir dos volumes de entrada e saída na parte superior, para que você possa dimensionar uma carga de trabalho real em relação a cada modelo de uma só vez. O contexto é mostrado em milhares de tokens (K) — uma janela de contexto de 1000K significa um milhão de tokens.
A qualidade da fronteira está ficando barata
A lacuna entre os modelos premium e orçamentários diminuiu drasticamente. Em 2026, você pode executar um modelo de peso aberto de classe de fronteira – Llama 4, Qwen 3, DeepSeek V4 – por uma fração do custo do GPT-5.5 ou Claude Opus, e para muitas tarefas de produção (classificação, extração, bate-papo de rotina) a diferença de qualidade é invisível para os usuários finais. Revendedores hospedados como Together, Fireworks, DeepInfra, Groq e Novita competem nos mesmos pesos, então o mesmo modelo pode aparecer várias vezes com preços ligeiramente diferentes. A atitude certa raramente é “usar o melhor modelo em todos os lugares” – é percurso por dificuldade, deixando um modelo barato lidar com a maior parte, enquanto um modelo de fronteira é reservado para a minoria difícil de chamadas.
Três alavancas abaixo do preço do modelo
Depois de escolher um modelo, três mecanismos reduzem ainda mais a conta. Cache de prompt cobra prompts repetidos do sistema e contexto em uma fração da taxa de entrada normal - dimensione-o no calculadora de economia de cache imediata. APIs em lote dê cerca de 50% de desconto para empregos que podem esperar - veja o calculadora de economia de API em lote. E rotear chamadas de rotina para um modelo menor costuma ser a maior alavanca de todas — modele-o no Calculadora de custo do roteador modelo AI.
Ferramentas e guias relacionados
Localizador de API LLM mais barato · Calculadora de custo de token LLM · Preços OpenAI vs Claude vs Gemini · Calculadora de preços LLM combinada · Calculadora de custo do roteador modelo AI · Todas as APIs de IA