—por consulta
—indexação única
—maior custo mensal
Modelo de resposta mais barato para este RAG
Mesma recuperação e tráfego, todos os modelos classificados por custo mensal.
| Modelo | Custo/mês | Por consulta |
|---|
⚠️ Estimativa editável utilizando preços de referência (julho de 2026). O custo do Vector DB varia enormemente de acordo com o provedor e o plano – defina o seu próprio. As contas reais também mudam com a reclassificação, armazenamento em cache, filtragem de metadados e frequência de reindexação. ·
Informar preço desatualizado →
Para onde realmente vai o dinheiro do RAG
As pessoas presumem que os embeddings são a parte cara do RAG. Geralmente são os mais baratos. A incorporação de 10.000 documentos curtos geralmente custa alguns centavos, pagos uma vez. O custo real e recorrente é o LLM em todas as consultas - e especificamente o contexto recuperado você o alimenta. Extraia 5 pedaços de 400 tokens e você adicionará 2.000 tokens de entrada a cada pergunta antes mesmo de o usuário terminar de digitar. Multiplique pelo volume da sua consulta e essa será a sua conta. Isso é RAG vetorial simples - se você estiver construindo um gráfico de conhecimento, o próprio passe de indexação terá seu próprio custo inicial de LLM, com preço separado no Calculadora de custos de indexação GraphRAG.
As grandes alavancas, em ordem: recuperar menos/pedaços menores (top-k e tamanho do pedaço), use um modelo de resposta mais barato para consultas de rotina e limite de duração da resposta. A reincorporação apenas de documentos alterados (não de todo o corpus) evita a recorrência do custo único. Construindo o resto do aplicativo? Avalie um bot de suporte com o calculadora de custos do chatbot, um recurso completo com o Estimador de custos de aplicativos de IAou o back-end completo com o Calculadora de custos de pilha de API. Apenas dimensionando a camada de armazenamento? Veja o calculadora de custos de banco de dados vetorial para Pinha vs Qdrant vs pgvector.
BinânciaTwilioGoogle GêmeosCoinGeckoIA e LLMsCusto do mecanismo de pesquisa / resposta de IA
Como funciona esta calculadora
O Calculadora de custos RAG estima o custo mensal de operação de um pipeline de geração com recuperação aumentada combinando três contas separadas. Primeiro, ele calcula um custo único de incorporação da contagem de documentos, da média de tokens por documento e do tamanho do bloco, calculado de acordo com o modelo de incorporação selecionado. Em segundo lugar, ele leva em conta o banco de dados vetorial que armazena essas incorporações de blocos. Terceiro, e geralmente o maior, calcula o valor recorrente custo LLM por consulta: seu volume de consulta mensal multiplicado pelos tokens de entrada dos pedaços recuperados (top-k) mais o comprimento da resposta gerada, precificado pelo modelo de resposta escolhido. O volume de consultas, top-k e o modelo de resposta são os principais motivadores.
Assista o configuração de recuperação top-k de perto. Cada pedaço recuperado é adicionado ao prompt de cada consulta, portanto, aumentar o top-k ou o tamanho do pedaço aumenta diretamente os tokens de entrada em todo consulta para o mês inteiro. Recuperar mais contexto pode melhorar a qualidade das respostas, mas o custo aumenta linearmente com as consultas. Uma dica prática: recupere menos pedaços e reserve um modelo de resposta maior e mais caro apenas onde a precisão o justificar. A incorporação é um custo inicial fixo, enquanto a fatura do LLM por consulta aumenta com o uso, portanto, otimize primeiro o caminho da consulta.
Perguntas frequentes
Qual é o custo de um sistema RAG?
Três partes. Único: incorporando todos os seus documentos em vetores. Contínuo mensalmente: o banco de dados de vetores que armazena e pesquisa esses vetores, mais o custo do LLM por consulta – que inclui os pedaços recuperados que você coloca no prompt como contexto. Para a maioria dos aplicativos RAG, o custo do LLM por consulta domina, porque o contexto recuperado pode ser muito maior do que a pergunta real do usuário.
Por que o contexto recuperado é o maior custo do RAG?
Cada consulta envia os k principais pedaços recuperados para o modelo como tokens de entrada. Recupere 5 pedaços de 400 tokens e você estará pagando por 2.000 tokens de entrada por consulta antes que o usuário tenha dito muito. Recuperar pedaços menores ou em menor quantidade, ou usar um modelo mais barato, reduz muito mais a conta do que alterar os modelos de incorporação.