Publicado em 21/06/2026 · números de referência, verifique antes de orçamentar
Se o seu aplicativo enviar o mesmo prompt longo do sistema, os mesmos documentos recuperados ou o mesmo histórico crescente de bate-papo em cada chamada, você estará pagando o preço total para reler o texto que a modelo já viu segundos atrás. Cache de prompt é a solução e é o maior desconto em itens de linha que a maioria das equipes nunca oferece. Feito da maneira certa, reduz o custo de insumos em 50% a 90%. Veja como funciona, os números de 2026, e onde silenciosamente não ajuda.
Um projeto de lei LLM é principalmente tokens de entrada × preço + tokens de saída × preço. O cache ataca a metade de entrada. Quando você marca uma parte do prompt como armazenável em cache, o provedor armazena seu formulário processado por um curto período; na próxima chamada que reutilizar exatamente o mesmo prefixo, você será cobrado fração da taxa de entrada normal para esses tokens em vez do valor total. O preço de saída permanece intacto – o cache apenas desconta a parte que você continua reenviando.
| Provedor | Preço de entrada em cache | Notas |
|---|---|---|
| OpenAI | ~50% da entrada | Automático em prompts longos, sem alteração de código |
| Antrópico (Claude) | ~10% da entrada em leituras | Até 90% de desconto – mas aproximadamente 25% de gravação premium na primeira vez |
| Google Gêmeos | ~25% da entrada | Cache de contexto; pode adicionar uma pequena taxa de armazenamento |
Digamos que um assistente de suporte envie um Prompt de sistema de 2.000 tokens + base de conhecimento em cada mensagem, mais aproximadamente 200 tokens da pergunta real do usuário e retorna aproximadamente 300 tokens de saída. Com 10.000 conversas por mês, o bloco fixo de 2.000 tokens é reenviado 10.000 vezes. Usando um modelo com entrada de US$ 2,50/1 milhão:
Dimensione isso para 100 mil ou 1 milhão de conversas e o prefixo estático será a diferença entre uma conta confortável e uma alarmante. Quanto maior e mais repetido for o seu contexto fixo, mais vale o armazenamento em cache – aplicativos RAG e agentes de prompts de sistema longos são os mais beneficiados.
Armazene em cache quando você reenvia um bloco grande e idêntico de contexto com frequência e rapidez: prompts do sistema, definições de ferramentas, documentos RAG, exemplos de poucas cenas, longo histórico de bate-papo. Não se preocupe com chamadas únicas, solicitações altamente variáveis ou cargas de trabalho com muitos resultados. Estruture o prompt primeiro estático, último variável, e o desconto está próximo do dinheiro grátis. Coloque um número no seu próprio caso com o calculadora de economia de cache imediatae comparar modelos no Calculadora de custos de API de IA.
Normalmente, 50–90% de desconto no preço de entrada da parte armazenada em cache, dependendo do provedor. Ele desconta apenas tokens de entrada repetidos, não de saída.
Não. É uma otimização de faturamento/latência — o modelo vê os mesmos tokens, você apenas paga menos para reenviar o prefixo armazenado em cache. As respostas permanecem inalteradas.
Quase sempre o prêmio de gravação (por exemplo, a sobretaxa de ~ 25% da Anthropic para criar o cache) em prefixos que não são reutilizados o suficiente antes de expirarem, ou um prefixo que altera cada chamada para que nunca atinja. O cache compensa com a reutilização frequente e idêntica.
Estimativas de referência – verifique sempre descontos e taxas na página oficial de preços do fornecedor.