Cada modelo, classificado por custo com cache
Mesma carga de trabalho, todos os modelos lado a lado. “Leitura em cache” é o preço de um token reutilizado; "gravar" é o custo único para armazená-lo.
| Modelo | Entrada | Leitura em cache | Sem cache / mês | Com cache /mo | Salvo |
|---|
O que é cache de prompt
A maioria dos aplicativos LLM envia o o mesmo grande pedaço de texto em todas as chamadas — um longo prompt do sistema, definições de ferramentas, um guia de estilo ou documentos recuperados em um pipeline RAG. Normalmente você paga o preço total de entrada por esses tokens todas as vezes. Cache de prompt permite que o provedor armazene esse prefixo fixo após a primeira chamada e cobre uma taxa com grande desconto para reutilizá-lo. Em Claude, um token em cache é lido aproximadamente 10% do preço normal dos factores de produção; na entrada em cache GPT e Gemini é sobre 25–50% mais barato. O único requisito é que a parte em cache permaneça idêntico e na frente do prompt — coloque a parte variável (a pergunta do usuário) por último.
Como funciona a matemática
A calculadora divide cada solicitação em duas partes. O tokens de prompt reutilizados pode ser armazenado em cache: em um cache bater eles cobram pela taxa de leitura barata, em um perder eles cobram pela taxa de gravação (um pouco mais cara) para atualizar o cache. O tokens novos - a entrada real do usuário que é sempre diferente - sempre paga o preço total da entrada e não pode ser armazenada em cache. Seu taxa de acerto do cache decide a combinação: os caches expiram após alguns minutos de inatividade (o TTL padrão do Anthropic é de aproximadamente 5 minutos), portanto, aplicativos constantes de alto tráfego mantêm o cache aquecido e atingem 90% +, enquanto aplicativos em rajadas ou de baixo volume são atualizados com mais frequência e atingem menos. Tente reduzir a taxa de acerto para 50% e observe a economia diminuir – armazenando em cache principalmente recompensas volume e um prefixo estável.
Quando o cache vale a pena (e quando não vale)
O cache compensa mais quando um contexto grande e imutável se repete em muitas chamadas: chatbots RAG reenviando os mesmos documentos, agentes reproduzindo longas definições e históricos de ferramentas ou qualquer produto com um prompt pesado do sistema. Nesses casos, corta rotineiramente entrada custo em 50–90%. Isso acontece nada para prompts únicos que nunca se repetem e pouco se o seu prefixo reutilizado for pequeno. Também não toca saída custo do token – o armazenamento em cache apenas desconta a entrada. Para modelar a imagem completa incluindo a saída, use o Estimador de custos de aplicativos de IA ou o por modelo Cláudio / GPT-4o / Gêmeos calculadoras.
Perguntas frequentes
Quanto o cache de prompt realmente economiza?
Se 80–90% da sua entrada for um prompt fixo ou contexto que se repete, o armazenamento em cache geralmente reduz o custo total de entrada em 50–90%. A economia aumenta de acordo com o volume e a estabilidade do prefixo reutilizado, e é próxima de zero para prompts que nunca se repetem.
Custa mais gravar o cache?
No Claude, escrever o cache custa cerca de 25% mais do que um token de entrada normal uma vez, mas cada leitura posterior é cerca de 90% mais barata - ele se paga após cerca de dois acessos. O cache OpenAI é automático, sem sobretaxa de gravação. Gemini adiciona uma pequena taxa de armazenamento por hora para o conteúdo em cache.
O que é uma taxa de acerto de cache?
A parcela de solicitações que encontram seu prompt já armazenado. Os caches expiram após alguns minutos de inatividade, portanto, os aplicativos de alto tráfego os mantêm aquecidos (mais de 90%), enquanto os aplicativos com picos ou de baixo volume são atualizados com mais frequência e atingem menos.
O cache reduz o custo do token de saída?
Não. O cache imediato apenas desconta o entrada (aviso) lado. Os tokens de saída/conclusão são sempre cobrados à taxa normal, portanto, um aplicativo tagarela e de resposta longa economiza menos no geral do que um aplicativo de contexto pesado e resposta curta.
Ferramentas e guias relacionados
Estimador de custos de aplicativos de IA · Calculadora de custos RAG · Calculadora de custos Claude · Calculadora de custos GPT-4o · Preços OpenAI vs Claude vs Gemini · os custos da API que dobram sua fatura