O custo de um chatbot RAG é dominado pelo contexto recuperado que você coloca no prompt, não a pergunta. Cada consulta = incorporação + pesquisa de vetor + uma chamada LLM carregando seus pedaços. Insira seu uso para ver a fatura mensal.

por mês
por consulta
por ano
consultas/mês

Detalhamento de custos por consulta

Componente$/consulta% do total
⚠️ Estimativas de referência (julho de 2026). A incorporação de tokens de ~$ 0,02/1 milhão e uma consulta vetorial são minúsculas ao lado da chamada LLM que transporta o contexto recuperado. Os preços variam de acordo com o modelo e o fornecedor – digite suas taxas reais. O armazenamento do banco de dados vetorial é cobrado separadamente (consulte a calculadora de custos do banco de dados vetorial). · Informar preço desatualizado →

Por que o contexto recuperado é o gerador de custos

As pessoas presumem que a questão impulsiona o custo do RAG. Isso não acontece - o pedaços recuperados você cola no prompt do. Extraia 8 pedaços de 500 tokens e cada consulta carrega 4.000 tokens de entrada antes que o modelo escreva uma palavra. É por isso recuperando menos pedaços, menores e melhores supera qualquer outra otimização, seguida por cache o prompt estático do sistema. Dimensione o armazenamento de vetores com o calculadora de custos de banco de dados vetoriale comparar modelos no Calculadora de custos de API de IA. Para um bot não RAG, consulte o calculadora de custos do chatbot.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Calculadora de rendimento provisionado (PTU)Calculadora de custos de conversação multivoltasCalculadora de marcação do AI GatewayCalculadora de preços de assento versus usoEstimador de custos de aplicativos de IA