HomeBlog › OpenAI vs Anthropic vs Gemini após armazenamento em cache

OpenAI vs Anthropic vs Gemini após cache imediato: diferença de custo real (2026)

Publicado em 15 de julho de 2026 · preços de referência, verifique antes de orçamentar

Cada comparação de custos de LLM que você viu provavelmente ignora o cache. Isso é um erro — porque o cache imediato altera a classificação de custos. Claude cobra uma taxa de redação; OpenAI não. O cache de contexto do Gemini custa por hora armazenada. Aqui está a verdadeira matemática.

Mecanismos de cache — como cada provedor funciona

ProvedorTipo de cacheCusto de gravação em cacheCusto de leitura de cacheCache TTLTokens mínimos
Antrópico (Claude)Cache de prefixo de prompt1,25× entrada padrão0,10× entrada padrão5 minutos (extensível)1,024
OpenAI (GPT-4o)Cache automáticoSem taxa de gravação0,50× entrada padrão~5 minutos1,024
Google (Gêmeos)Cache de contextoSem taxa de gravação0,25× entrada padrãoFaturado por hora armazenada32,768

Principais diferenças estruturais:

Os preços base (sem cache)

ModeloInsira $/1 milhãoSaída $/1 milhão
Claude Soneto 4$3.00$15.00
GPT-4o$2.50$10.00
Gêmeos 2.5 Pró$1.25$10.00

Sem cache: Gemini 2.5 Pro é mais barato na entrada ($ 1,25 x $ 2,50 x $ 3,00). Mas uma vez aplicado o cache, o cenário muda.

O cenário: prompt do sistema de 10.000 tokens, 500 solicitações/dia

Um aplicativo de produção típico: você tem um prompt de sistema de 10.000 tokens (instruções + contexto + exemplos) e envia 500 solicitações/dia. Cada solicitação adiciona 300 tokens de entrada do usuário e recebe 400 tokens de volta.

Custo sem cache (mensal, 15.000 solicitações)

ModeloEntrada/requisição (10.300 tok)Saída/necessidade (400 tok)Mensalmente (necessário 15 mil)
GPT-4o$0.02575$0.004$446
Claude Soneto 4$0.0309$0.006$550
Gêmeos 2.5 Pró$0.012875$0.004$255

Custo COM cache aplicado (mesmas 15.000 solicitações/mês)

O prompt do sistema de 10.000 tokens é armazenado em cache. Cada solicitação subsequente lê 10.000 tokens armazenados em cache + 300 novos tokens de entrada.

ModeloLeitura de cache /1MNova entrada /1MMensalversus sem cache
GPT-4o (cache automático)$1.25$2.50$204−$242 (−54%)
Claude Soneto 4 + cache$0.30$3.00$117−$433 (−79%)
Gemini 2.5 Pro + cache de contexto$0.3125$1.25US$ 58*−$197 (−77%)

*O cache de contexto Gemini também cobra US$ 4,50/hora por 10 mil tokens armazenados. Com 1 instância de cache em execução 24 horas por dia, 7 dias por semana: +$3,24/mês de custo de armazenamento. Adicionado separadamente abaixo.

Espere – Claude é mais barato depois do cache? Sim. Nessa escala (15 mil solicitações/mês com prompt do sistema de 10 mil), Claude Sonnet 4 com cache custa US$ 117/mês versus US$ 204/mês do GPT-4o e ~US$ 61/mês do Gemini. O desconto de 90% na leitura do cache supera o preço base mais alto de Claude quando você tem um grande prefixo repetido.

O cache write premium (somente Antrópico)

Na primeira solicitação, a Anthropic cobra 1,25× para gravar o cache. Para um prompt do sistema de 10.000 tokens a US$ 3,00/1 milhão: a primeira solicitação custa US$ 0,0375 versus US$ 0,030 padrão. Os US$ 0,0075 extras são recuperados após apenas 1,14 acessos ao cache. Se você estiver fazendo 500 solicitações/dia, esse prêmio de gravação será insignificante. Para uso intenso e de baixo volume, isso faz sentido.

A armadilha dos custos de armazenamento da Gemini

O cache de contexto do Gemini oferece 75% de desconto nas leituras – o maior desconto. Mas cobra por hora pelo conteúdo armazenado, independentemente do tráfego. Para um cache de 10.000 tokens em execução 24 horas por dia, 7 dias por semana:

Para casos de uso de contexto amplo (assistente de base de código, análise de documentos), o custo de armazenamento do Gemini pode minar a vantagem do desconto de cache. Calcule ambos os termos antes de assumir que Gêmeos vence.

A nova classificação de custo após o armazenamento em cache

Sem cache: Gemini 2.5 Pro > GPT-4o > Claude Sonnet (do mais barato ao mais caro)
Com cache (prompt grande do sistema, alto volume): Gêmeos ≈ Claude > GPT-4o (Claude alcança dramaticamente)
Com cache (rajada, baixo volume): GPT-4o > Claude > Gemini (vitórias sem taxa de gravação + sem taxa de armazenamento da OpenAI)

O provedor “mais barato” depende do seu padrão de tráfego e estrutura de prompt.

Quando cada abordagem vence

Use caseMelhor escolhaRazão
Aplicativo de alto volume, grande prompt de sistema fixo (>2k tokens,>200 req/dia)Claude Soneto 490% de desconto em cache + sem taxa de armazenamento = menor total em escala
Tráfego variável, solicitações intermitentesGPT-4oSem taxa de gravação, sem taxa de armazenamento, automático – muito indulgente
Contexto muito grande (>32 mil tokens) em alto volumeGêmeos 2.5 PróDesconto de 75% na leitura de cache; custo de armazenamento pequeno em relação à economia de insumos
Baixo volume (<50 req/dia), pequeno avisoGêmeos 2.0 FlashEconomia mínima de armazenamento em cache; O preço bruto do Flash vence
Desenvolvimento/teste, uso imprevisívelGPT-4o miniMais barato em volume baixo; cache automático sem sobrecarga

A fórmula de cálculo

Para comparar provedores com cache para seu caso de uso:

# Custo mensal por provedor com cache:
cache_tokens = seu_sistema_prompt_tokens
novos_tokens = user_message_tokens
output_tokens = média_resposta_tokens
solicitações = solicitações_diárias × 30

# OpenAI (automático, sem taxa de gravação):
mensal = solicitações × (cache_tokens × cache_rate + new_tokens × input_rate + output_tokens × output_rate) / 1_000_000

# Antrópico (explícito, escreva prêmio na primeira solicitação):
primeiro_req = cache_tokens × (taxa_de_entrada × 1,25) / 1_000_000 #escrever prêmio
resto = (solicitações-1) × (cache_tokens × (taxa_de_entrada × 0,10) + novos_tokens × taxa_de_entrada) / 1_000_000
custo_saída = solicitações × tokens_saída × taxa_saída / 1_000_000
mensal = primeiro_req + resto + custo_produção

Ou apenas use nosso calculadora de custos — defina suas contagens de tokens e os resultados refletirão as taxas padrão (o cache se aplica automaticamente à infraestrutura do provedor).

Preços de referência, julho de 2026. Os mecanismos e taxas de cache mudam frequentemente – verifique na documentação do OpenAI, Anthropic e Google. Encontrou um erro? Denuncie →