Publicado em 15 de julho de 2026 · preços de referência, verifique antes de orçamentar
Cada comparação de custos de LLM que você viu provavelmente ignora o cache. Isso é um erro — porque o cache imediato altera a classificação de custos. Claude cobra uma taxa de redação; OpenAI não. O cache de contexto do Gemini custa por hora armazenada. Aqui está a verdadeira matemática.
| Provedor | Tipo de cache | Custo de gravação em cache | Custo de leitura de cache | Cache TTL | Tokens mínimos |
|---|---|---|---|---|---|
| Antrópico (Claude) | Cache de prefixo de prompt | 1,25× entrada padrão | 0,10× entrada padrão | 5 minutos (extensível) | 1,024 |
| OpenAI (GPT-4o) | Cache automático | Sem taxa de gravação | 0,50× entrada padrão | ~5 minutos | 1,024 |
| Google (Gêmeos) | Cache de contexto | Sem taxa de gravação | 0,25× entrada padrão | Faturado por hora armazenada | 32,768 |
Principais diferenças estruturais:
| Modelo | Insira $/1 milhão | Saída $/1 milhão |
|---|---|---|
| Claude Soneto 4 | $3.00 | $15.00 |
| GPT-4o | $2.50 | $10.00 |
| Gêmeos 2.5 Pró | $1.25 | $10.00 |
Sem cache: Gemini 2.5 Pro é mais barato na entrada ($ 1,25 x $ 2,50 x $ 3,00). Mas uma vez aplicado o cache, o cenário muda.
Um aplicativo de produção típico: você tem um prompt de sistema de 10.000 tokens (instruções + contexto + exemplos) e envia 500 solicitações/dia. Cada solicitação adiciona 300 tokens de entrada do usuário e recebe 400 tokens de volta.
| Modelo | Entrada/requisição (10.300 tok) | Saída/necessidade (400 tok) | Mensalmente (necessário 15 mil) |
|---|---|---|---|
| GPT-4o | $0.02575 | $0.004 | $446 |
| Claude Soneto 4 | $0.0309 | $0.006 | $550 |
| Gêmeos 2.5 Pró | $0.012875 | $0.004 | $255 |
O prompt do sistema de 10.000 tokens é armazenado em cache. Cada solicitação subsequente lê 10.000 tokens armazenados em cache + 300 novos tokens de entrada.
| Modelo | Leitura de cache /1M | Nova entrada /1M | Mensal | versus sem cache |
|---|---|---|---|---|
| GPT-4o (cache automático) | $1.25 | $2.50 | $204 | −$242 (−54%) |
| Claude Soneto 4 + cache | $0.30 | $3.00 | $117 | −$433 (−79%) |
| Gemini 2.5 Pro + cache de contexto | $0.3125 | $1.25 | US$ 58* | −$197 (−77%) |
*O cache de contexto Gemini também cobra US$ 4,50/hora por 10 mil tokens armazenados. Com 1 instância de cache em execução 24 horas por dia, 7 dias por semana: +$3,24/mês de custo de armazenamento. Adicionado separadamente abaixo.
Na primeira solicitação, a Anthropic cobra 1,25× para gravar o cache. Para um prompt do sistema de 10.000 tokens a US$ 3,00/1 milhão: a primeira solicitação custa US$ 0,0375 versus US$ 0,030 padrão. Os US$ 0,0075 extras são recuperados após apenas 1,14 acessos ao cache. Se você estiver fazendo 500 solicitações/dia, esse prêmio de gravação será insignificante. Para uso intenso e de baixo volume, isso faz sentido.
O cache de contexto do Gemini oferece 75% de desconto nas leituras – o maior desconto. Mas cobra por hora pelo conteúdo armazenado, independentemente do tráfego. Para um cache de 10.000 tokens em execução 24 horas por dia, 7 dias por semana:
Para casos de uso de contexto amplo (assistente de base de código, análise de documentos), o custo de armazenamento do Gemini pode minar a vantagem do desconto de cache. Calcule ambos os termos antes de assumir que Gêmeos vence.
| Use case | Melhor escolha | Razão |
|---|---|---|
| Aplicativo de alto volume, grande prompt de sistema fixo (>2k tokens,>200 req/dia) | Claude Soneto 4 | 90% de desconto em cache + sem taxa de armazenamento = menor total em escala |
| Tráfego variável, solicitações intermitentes | GPT-4o | Sem taxa de gravação, sem taxa de armazenamento, automático – muito indulgente |
| Contexto muito grande (>32 mil tokens) em alto volume | Gêmeos 2.5 Pró | Desconto de 75% na leitura de cache; custo de armazenamento pequeno em relação à economia de insumos |
| Baixo volume (<50 req/dia), pequeno aviso | Gêmeos 2.0 Flash | Economia mínima de armazenamento em cache; O preço bruto do Flash vence |
| Desenvolvimento/teste, uso imprevisível | GPT-4o mini | Mais barato em volume baixo; cache automático sem sobrecarga |
Para comparar provedores com cache para seu caso de uso:
Ou apenas use nosso calculadora de custos — defina suas contagens de tokens e os resultados refletirão as taxas padrão (o cache se aplica automaticamente à infraestrutura do provedor).