HomeBlog › Cache de prompt

Como o cache imediato reduz sua conta de LLM em até 90%

Publicado em 21/06/2026 · números de referência, verifique antes de orçamentar

Se o seu aplicativo enviar o mesmo prompt longo do sistema, os mesmos documentos recuperados ou o mesmo histórico crescente de bate-papo em cada chamada, você estará pagando o preço total para reler o texto que a modelo já viu segundos atrás. Cache de prompt é a solução e é o maior desconto em itens de linha que a maioria das equipes nunca oferece. Feito da maneira certa, reduz o custo de insumos em 50% a 90%. Veja como funciona, os números de 2026, e onde silenciosamente não ajuda.

O que o cache de prompt realmente faz

Um projeto de lei LLM é principalmente tokens de entrada × preço + tokens de saída × preço. O cache ataca a metade de entrada. Quando você marca uma parte do prompt como armazenável em cache, o provedor armazena seu formulário processado por um curto período; na próxima chamada que reutilizar exatamente o mesmo prefixo, você será cobrado fração da taxa de entrada normal para esses tokens em vez do valor total. O preço de saída permanece intacto – o cache apenas desconta a parte que você continua reenviando.

Os descontos de 2026 (referência)

ProvedorPreço de entrada em cacheNotas
OpenAI~50% da entradaAutomático em prompts longos, sem alteração de código
Antrópico (Claude)~10% da entrada em leiturasAté 90% de desconto – mas aproximadamente 25% de gravação premium na primeira vez
Google Gêmeos~25% da entradaCache de contexto; pode adicionar uma pequena taxa de armazenamento
⚠️ Números de referência, junho de 2026 — descontos exatos, vida útil do cache e quaisquer alterações nas taxas de armazenamento. Confirme na página de preços de cada provedor. Antrópico e Gemini usam marcadores de cache explícitos; OpenAI aplica-o automaticamente a prefixos qualificados.

Um exemplo trabalhado

Digamos que um assistente de suporte envie um Prompt de sistema de 2.000 tokens + base de conhecimento em cada mensagem, mais aproximadamente 200 tokens da pergunta real do usuário e retorna aproximadamente 300 tokens de saída. Com 10.000 conversas por mês, o bloco fixo de 2.000 tokens é reenviado 10.000 vezes. Usando um modelo com entrada de US$ 2,50/1 milhão:

Dimensione isso para 100 mil ou 1 milhão de conversas e o prefixo estático será a diferença entre uma conta confortável e uma alarmante. Quanto maior e mais repetido for o seu contexto fixo, mais vale o armazenamento em cache – aplicativos RAG e agentes de prompts de sistema longos são os mais beneficiados.

Quando o cache NÃO ajuda (as pegadinhas)

A regra prática

Armazene em cache quando você reenvia um bloco grande e idêntico de contexto com frequência e rapidez: prompts do sistema, definições de ferramentas, documentos RAG, exemplos de poucas cenas, longo histórico de bate-papo. Não se preocupe com chamadas únicas, solicitações altamente variáveis ​​ou cargas de trabalho com muitos resultados. Estruture o prompt primeiro estático, último variável, e o desconto está próximo do dinheiro grátis. Coloque um número no seu próprio caso com o calculadora de economia de cache imediatae comparar modelos no Calculadora de custos de API de IA.

Perguntas frequentes

Quanto o cache imediato pode economizar?

Normalmente, 50–90% de desconto no preço de entrada da parte armazenada em cache, dependendo do provedor. Ele desconta apenas tokens de entrada repetidos, não de saída.

O cache imediato altera as respostas do modelo?

Não. É uma otimização de faturamento/latência — o modelo vê os mesmos tokens, você apenas paga menos para reenviar o prefixo armazenado em cache. As respostas permanecem inalteradas.

Por que o cache fez minha conta subir?

Quase sempre o prêmio de gravação (por exemplo, a sobretaxa de ~ 25% da Anthropic para criar o cache) em prefixos que não são reutilizados o suficiente antes de expirarem, ou um prefixo que altera cada chamada para que nunca atinja. O cache compensa com a reutilização frequente e idêntica.

Estimativas de referência – verifique sempre descontos e taxas na página oficial de preços do fornecedor.