Custo equivalente ao RAG estático versus custo real do mecanismo de resposta
As mesmas entradas e saídas do LLM, menos a taxa da API de pesquisa na web ao vivo - isso é o que custaria exatamente a mesma consulta de um sistema RAG estático pré-indexado e sem pesquisa ao vivo. A lacuna é o prêmio da pesquisa ao vivo.
| Base de custo | Custo/consulta | Custo mensal |
|---|---|---|
| Equivalente a RAG estático (apenas síntese LLM, sem taxa de pesquisa ao vivo) | — | — |
| Custo real do mecanismo de resposta (síntese LLM + API de pesquisa ao vivo) | — | — |
Custo por snippets recuperados (top-K)
Todo o resto mantido nos valores acima, analisa quantos resultados de pesquisa são inseridos no contexto do LLM por consulta. Mais snippets podem significar respostas mais fundamentadas, mas cada snippet extra são tokens de entrada extras cobrados em cada consulta.
| Trechos (topo K) | Tokens de entrada/consulta | Custo/consulta | Custo mensal |
|---|
Como isso se conecta a outras ferramentas
Esta página custa um mecanismo de resposta de pesquisa ao vivo - um pipeline no estilo Perplexity / You.com / Bing Copilot, onde cada consulta chega a uma API de pesquisa na web de terceiros antes que o LLM veja a pergunta. Essa é uma arquitetura diferente de um sistema construído em torno de um corpus que você já possui: se sua etapa de recuperação for uma pesquisa vetorial em documentos que você mesmo indexou, sem taxa de API de pesquisa ao vivo em qualquer consulta, o preço é o Calculadora de custos RAG em vez disso, ou o Calculadora de custos RAG Chatbot para uma interface conversacional com histórico sobre o mesmo corpus estático. Se você estiver avaliando especificamente uma arquitetura de gráfico de conhecimento em vez de uma recuperação vetorial simples, o Calculadora de custos de indexação GraphRAG avalia o passe de extração único que o constrói. E como cada consulta aqui paga o preço total do token de entrada para o mesmo prompt do sistema e tokens de sobrecarga repetidos, verifique se o cache de prompt pode reduzir esse custo recorrente no Calculadora de economia de cache imediata.