O custo de um chatbot RAG é dominado pelo contexto recuperado que você coloca no prompt, não a pergunta. Cada consulta = incorporação + pesquisa de vetor + uma chamada LLM carregando seus pedaços. Insira seu uso para ver a fatura mensal.
Detalhamento de custos por consulta
| Componente | $/consulta | % do total |
|---|
Por que o contexto recuperado é o gerador de custos
As pessoas presumem que a questão impulsiona o custo do RAG. Isso não acontece - o pedaços recuperados você cola no prompt do. Extraia 8 pedaços de 500 tokens e cada consulta carrega 4.000 tokens de entrada antes que o modelo escreva uma palavra. É por isso recuperando menos pedaços, menores e melhores supera qualquer outra otimização, seguida por cache o prompt estático do sistema. Dimensione o armazenamento de vetores com o calculadora de custos de banco de dados vetoriale comparar modelos no Calculadora de custos de API de IA. Para um bot não RAG, consulte o calculadora de custos do chatbot.