Calculadora de custo de armazenamento de cache de contexto
✓ Última verificação: 28/07/2026· Cache explícito Gemini/OpenAI· relatar um problema →
O cache de contexto explícito cobra um taxa de armazenamento por hora enquanto o conteúdo em cache estiver ativo – além das leituras mais baratas – um imposto que as calculadoras de cache comuns ignoram. Isso precifica o taxa de armazenamento, coloca-o contra o leia economias, e diz a você o leituras mínimas e o vida útil máxima ociosa antes que o armazenamento consuma todos os benefícios.
—
economia líquida vs sem cache
—taxa de armazenamento
—leituras de equilíbrio
—vida útil máxima ociosa
Economia líquida à medida que você mantém o cache ativo por mais tempo
A economia de leitura é determinada por quantas leituras você atende; apenas a taxa de armazenamento aumenta com o tempo de vida. Cada linha mantém as mesmas leituras, mas com uma vida útil mais longa. Observe a rede passar de verde para vermelho quando o armazenamento ultrapassar a economia. A vida que você escolheu está marcada; a última linha lucrativa é o ponto ideal.
Vida
Taxa de armazenamento
Leia as economias
Líquido
O imposto que as calculadoras de cache deixam de fora
Cada guia de cache rápido vende o mesmo título: leituras em cache custam um décimo da entrada normal, então o cache reduz sua conta em 90%. Isso é verdade para as leituras. Não é toda a conta. O cache de contexto explícito – o tipo em que você carrega deliberadamente um grande contexto e recebe de volta um identificador para reutilizá-lo – vem com uma taxa de armazenamento que funciona de acordo com o relógio, não com base no uso. Gemini cobra cerca de 4,50 dólares por milhão de tokens por hora para manter o conteúdo 2,5 Pro em cache, portanto, um contexto de 100.000 tokens mantido ativo por um dia custa cerca de 10,80 dólares em armazenamento antes que alguém o leia. Em um cache bem usado, tudo bem, porque a economia de leitura o supera. Em um cache que fica praticamente ocioso – um documento sobre o qual alguém pode perguntar, um contexto conectado a um generoso tempo de vida “por precaução” – a linha de armazenamento silenciosamente se torna o maior número na fatura, e o cache perde dinheiro mesmo que cada leitura pareça uma pechincha. As duas questões que realmente decidem são quantas leituras você precisa antes que a economia cubra o armazenamento e por quanto tempo você pode deixar o cache ativo antes que o medidor ultrapasse essa economia. Esta calculadora responde a ambos. Se o seu contexto se repetir em todas as chamadas, em vez de permanecer em um cache explícito, avalie o caso implícito com o valor calculadora de economia de cache imediata; para pesar um tempo de vida curto versus longo em relação à sua taxa de acerto, use o cache TTL e calculadora de taxa de acerto; e para ver se o prêmio de gravação será compensado, execute o calculadora de ponto de equilíbrio de gravação em cache.
Ele divide o custo em três linhas. Armazenar são os tokens armazenados em cache (em milhões) vezes o tempo de vida em horas vezes a taxa de armazenamento - ele funciona no relógio, independentemente de você ler ou não. O caminho sem cache é o que você pagaria sem cache: cada leitura paga o preço total de entrada para todo o contexto. O caminho do cache é uma gravação pelo preço de entrada total, mais cada leitura pelo preço mais barato em cache, mais a taxa de armazenamento. A economia líquida é o caminho sem cache menos o caminho do cache. O leituras de equilíbrio é o menor número de leituras em que a economia de leitura cobre a taxa de armazenamento; o vida útil máxima ociosa é o máximo de tempo que você pode manter o cache ativo em sua contagem de leituras antes que o armazenamento ultrapasse a economia. Ele assume uma gravação de cache na janela e ignora os tokens de saída da solicitação, que são iguais em ambos os caminhos; os preços reais do cache explícito e os limites mínimos de token variam de acordo com o provedor, portanto, confirme na página oficial de preços.
Perguntas frequentes
Qual é o custo de armazenamento em cache de contexto e por que ele existe?
O cache explícito permite fazer upload de um contexto grande e estável uma vez e reutilizá-lo a um preço de leitura barato, em vez de reenviá-lo a cada chamada. Mas você também paga uma taxa de armazenamento por hora enquanto o cache durar, usado ou não. Gemini cobra cerca de US$ 4,50 por milhão de tokens por hora no 2.5 Pro, portanto, um cache de 100 mil tokens ativo por dia custa aproximadamente US$ 10,80 em armazenamento antes de qualquer leitura. Essa linha de armazenamento é o imposto que as calculadoras de cache comuns deixam de fora.
Qual é o preço do armazenamento em cache de contexto?
Taxa em dólares por milhão de tokens por hora, vezes os tokens armazenados em cache (em milhões), vezes as horas ativas. Gemini 2.5 Pro custa ~$4,50/M/hora, Flash ~$1,00. Um cache de 100 mil tokens (0,1 milhão) por 24 horas no Pro é 0,1 × 24 × 4,50 = $ 10,80. Ele é determinado pelo tempo e tamanho, não pelo uso – um cache ocioso ainda executa o medidor, o oposto das leituras, que custam apenas quando usadas.
Quantas leituras antes de armazenar em cache um grande contexto compensam?
O suficiente para que a economia por leitura (preço total de entrada menos preço em cache) exceda a taxa fixa de armazenamento. Para um contexto Gemini Pro de 100 mil tokens ativo por dia, são cerca de 117 leituras antes que a economia cubra o armazenamento de US$ 10,80 – abaixo disso, o armazenamento em cache custa mais do que pagar o preço total de cada chamada. A calculadora resolve esse mínimo para seu tamanho, preços e vida útil.
Quando um cache de contexto ocioso começa a perder dinheiro?
Uma vez que sua taxa de armazenamento supere as economias de leitura já acumuladas. O armazenamento é acumulado a cada hora, portanto, para uma determinada contagem de leituras, há um tempo de vida máximo após o qual o cache passa de salvo para gravação. Com 200 leituras em um cache Gemini Pro de 100k, a economia absorve aproximadamente 41 horas de armazenamento; mantenha-o ativo por mais tempo e você pagará para armazenar conteúdo cujo benefício você já coletou. Combine o tempo de vida do cache com o tráfego real, não com cautela.