Como funciona esta calculadora
O Calculadora de custos RAG Chatbot estima quanto custa para operar um chatbot com recuperação aumentada, tanto por consulta e por mês. Você insere seu consultas por mês, o tokens de contexto recuperados cada consulta é exibida, o fichas de resposta o modelo gera, e seu LLM entrada e saída preços por milhão de tokens. Ele multiplica os tokens de contexto pela taxa de entrada e os tokens de resposta pela taxa de saída para obter um custo por consulta e, em seguida, dimensiona isso por volume mensal. O maior motivador geralmente é o contexto recuperado: cada pedaço anexado é cobrado como entrada no cada chamada, portanto o tamanho da recuperação e o volume da consulta dominam mais a conta do que o comprimento da resposta.
A principal compensação é quanto contexto você recupera. Mais pedaços recuperados podem melhorar a qualidade da resposta, mas como esse contexto é reenviado e cobrado novamente em cada consulta, dobrá-lo praticamente duplica seu custo de entrada em escala. Tente reduzir o número ou o tamanho das passagens recuperadas e observe como o número por mês se move – muitas vezes você pode cortar substancialmente o contexto com pouca perda de qualidade. Porque saída os tokens geralmente têm um preço mais alto por token, mas em número muito menor; controlar respostas detalhadas ajuda menos do que controlar o contexto. Use a calculadora para encontrar o ponto onde a recuperação é grande o suficiente para responder bem, mas não tão grande que o custo cresça mais rápido do que o valor que cada consulta entrega.
Perguntas frequentes
Quanto custa um chatbot RAG por consulta?
Cada consulta RAG paga pela incorporação da pergunta, uma pesquisa no banco de dados vetorial e a chamada LLM que inclui os pedaços recuperados como contexto. A entrada LLM (seu contexto recuperado pode conter milhares de tokens) geralmente domina; os embeddings e a consulta vetorial custam centavos ou menos.
Como faço para cortar custos de RAG?
Recupere menos e menores pedaços, armazene em cache o prompt do sistema, use um modelo mais barato para respostas de rotina e armazene em cache para consultas repetidas. O tamanho do contexto recuperado é a maior alavanca de custo.