Uso da API LLM

Custo de cache

Métrica Sem cache Com cache

Como funciona o cache semântico

Cada consulta recebida é convertida em um vetor de incorporação. O cache verifica se existe um vetor semelhante (semelhança de cosseno ≥ limite, normalmente 0,92–0,97). Se sim, a resposta armazenada é retornada instantaneamente – zero tokens LLM consumidos. Caso contrário, a consulta vai para o LLM e o resultado é armazenado para acessos futuros.

De onde vem a taxa de acerto: consultas repetitivas (bots de perguntas frequentes, suporte ao cliente) atingem 30–60%. Consultas diversas abertas (assistentes de codificação, redação criativa) atingem de 5 a 15%. Você pode aumentar a taxa de acerto diminuindo o limite de similaridade, mas isso corre o risco de fornecer respostas em cache ligeiramente erradas.

Custo de incorporação: Cada consulta (acerto ou erro) custa uma pesquisa de incorporação. Com US$ 0,02/1 milhão de tokens, incorporar uma consulta de 300 tokens custa US$ 0,000006 – insignificante, a menos que você tenha milhões de consultas por dia.

Veja também: Economia imediata de cache · Calculadora de custos RAG · Custo do banco de dados vetorial

Perguntas frequentes

O que é um cache semântico para LLMs?

Um cache semântico armazena respostas LLM anteriores e usa similaridade de incorporação para detectar consultas semanticamente semelhantes. Quando a similaridade está acima do limite, a resposta armazenada em cache é retornada sem chamar o LLM, economizando o custo total do token para essa consulta.

Qual taxa de acerto de cache é realista?

Os bots de suporte ao cliente com perguntas repetitivas geralmente apresentam taxas de acerto de 30 a 60%. Chatbots abertos ou assistentes de codificação podem atingir de 5 a 15%. Um bom limite de similaridade (0,92–0,97 cosseno) equilibra a taxa de acerto em relação à degradação da qualidade.

Qual é a taxa de acerto do ponto de equilíbrio?

Ponto de equilíbrio = custo de cache ÷ (consultas/mês × tokens × preço/token LLM). Se seu LLM custa US$ 0,003/consulta e o cache custa US$ 50/mês com 100.000 consultas/mês, você precisa de apenas 1,7% de taxa de acerto para atingir o ponto de equilíbrio.

Como o cache semântico difere do cache de prompt?

O cache de prompt (Anthropic cache_control, cache automático OpenAI) reutiliza a computação KV para prefixos de token idênticos. O cache semântico está no nível do aplicativo – ele fornece respostas completas em cache quando as consultas são semanticamente semelhantes. Eles são complementares.

Quais ferramentas fornecem cache semântico para LLMs?

Opções populares: GPTCache (código aberto), Momento Vector Index (gerenciado), Zep (camada de memória), LangChain CacheBackedEmbeddings, Redis com pesquisa vetorial. As opções gerenciadas custam entre US$ 10 e US$ 200/mês; O Redis auto-hospedado custa de US$ 5 a US$ 30/mês em uma VM pequena.