Taxa de acertos = parcela de solicitações que encontram o prompt já armazenado em cache. Aplicativos de longa duração e alto volume ficam entre 85 e 98%.
custo de entrada / mês (sem cache)
com cache
você salva / mês
redução de custos

Cada modelo, classificado por custo com cache

Mesma carga de trabalho, todos os modelos lado a lado. “Leitura em cache” é o preço de um token reutilizado; "gravar" é o custo único para armazená-lo.

ModeloEntradaLeitura em cacheSem cache / mêsCom cache /moSalvo
⚠️ Estimativa usando taxas de referência por milhão de tokens (junho de 2026). Os preços reais mudam frequentemente e variam de acordo com o modelo exato, nível e região. A Anthropic cobra um prêmio de gravação de aproximadamente 25% na criação de cache, mas leituras aproximadamente 90% mais baratas; O cache OpenAI é automático, sem sobretaxa de gravação; Gemini adiciona uma pequena taxa de armazenamento por hora não modelada aqui. Sempre confirme na página oficial de preços de cada fornecedor. · Informar preço desatualizado →

O que é cache de prompt

A maioria dos aplicativos LLM envia o o mesmo grande pedaço de texto em todas as chamadas — um longo prompt do sistema, definições de ferramentas, um guia de estilo ou documentos recuperados em um pipeline RAG. Normalmente você paga o preço total de entrada por esses tokens todas as vezes. Cache de prompt permite que o provedor armazene esse prefixo fixo após a primeira chamada e cobre uma taxa com grande desconto para reutilizá-lo. Em Claude, um token em cache é lido aproximadamente 10% do preço normal dos factores de produção; na entrada em cache GPT e Gemini é sobre 25–50% mais barato. O único requisito é que a parte em cache permaneça idêntico e na frente do prompt — coloque a parte variável (a pergunta do usuário) por último.

Como funciona a matemática

A calculadora divide cada solicitação em duas partes. O tokens de prompt reutilizados pode ser armazenado em cache: em um cache bater eles cobram pela taxa de leitura barata, em um perder eles cobram pela taxa de gravação (um pouco mais cara) para atualizar o cache. O tokens novos - a entrada real do usuário que é sempre diferente - sempre paga o preço total da entrada e não pode ser armazenada em cache. Seu taxa de acerto do cache decide a combinação: os caches expiram após alguns minutos de inatividade (o TTL padrão do Anthropic é de aproximadamente 5 minutos), portanto, aplicativos constantes de alto tráfego mantêm o cache aquecido e atingem 90% +, enquanto aplicativos em rajadas ou de baixo volume são atualizados com mais frequência e atingem menos. Tente reduzir a taxa de acerto para 50% e observe a economia diminuir – armazenando em cache principalmente recompensas volume e um prefixo estável.

Quando o cache vale a pena (e quando não vale)

O cache compensa mais quando um contexto grande e imutável se repete em muitas chamadas: chatbots RAG reenviando os mesmos documentos, agentes reproduzindo longas definições e históricos de ferramentas ou qualquer produto com um prompt pesado do sistema. Nesses casos, corta rotineiramente entrada custo em 50–90%. Isso acontece nada para prompts únicos que nunca se repetem e pouco se o seu prefixo reutilizado for pequeno. Também não toca saída custo do token – o armazenamento em cache apenas desconta a entrada. Para modelar a imagem completa incluindo a saída, use o Estimador de custos de aplicativos de IA ou o por modelo Cláudio / GPT-4o / Gêmeos calculadoras.

Perguntas frequentes

Quanto o cache de prompt realmente economiza?

Se 80–90% da sua entrada for um prompt fixo ou contexto que se repete, o armazenamento em cache geralmente reduz o custo total de entrada em 50–90%. A economia aumenta de acordo com o volume e a estabilidade do prefixo reutilizado, e é próxima de zero para prompts que nunca se repetem.

Custa mais gravar o cache?

No Claude, escrever o cache custa cerca de 25% mais do que um token de entrada normal uma vez, mas cada leitura posterior é cerca de 90% mais barata - ele se paga após cerca de dois acessos. O cache OpenAI é automático, sem sobretaxa de gravação. Gemini adiciona uma pequena taxa de armazenamento por hora para o conteúdo em cache.

O que é uma taxa de acerto de cache?

A parcela de solicitações que encontram seu prompt já armazenado. Os caches expiram após alguns minutos de inatividade, portanto, os aplicativos de alto tráfego os mantêm aquecidos (mais de 90%), enquanto os aplicativos com picos ou de baixo volume são atualizados com mais frequência e atingem menos.

O cache reduz o custo do token de saída?

Não. O cache imediato apenas desconta o entrada (aviso) lado. Os tokens de saída/conclusão são sempre cobrados à taxa normal, portanto, um aplicativo tagarela e de resposta longa economiza menos no geral do que um aplicativo de contexto pesado e resposta curta.

Ferramentas e guias relacionados

Estimador de custos de aplicativos de IA · Calculadora de custos RAG · Calculadora de custos Claude · Calculadora de custos GPT-4o · Preços OpenAI vs Claude vs Gemini · os custos da API que dobram sua fatura

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Economia de custos com IAOtimização de custos LLMPista de nível gratuitoCalculadora de economia de deflexão de suporte de IANíveis de API gratuitos