Uma conta DB vetorial vem de três números, não do modelo. Quantos vetores você mantém, qual a largura de cada um (sua dimensão) e quantas consultas você executa. Tudo abaixo é derivado desses três - o armazenamento é vectors × dimension × 4 bytes além de sobrecarga de índice e escalas de custo de consulta com volume de leitura.

armazenamento indexado
mais barato / mês
fornecedor mais barato
mais barato / ano

Custo mensal por provedor

Mesma carga de trabalho, classificada como mais barata em primeiro lugar. Estimativa de armazenamento + consulta, antes de qualquer nível gratuito.

ProvedorModeloHusa. / mês
⚠️ Estimativa utilizando taxas de referência simplificadas (julho de 2026). Os modelos de preços do Vector DB diferem muito - uso de contas Pinecone e Zilliz (unidades de armazenamento + leitura/gravação), computação/RAM de contas Qdrant e Weaviate e pgvector é apenas Postgres em um servidor que você executa. Combinamos cada um em um formato de armazenamento ($/GB-mês) + consulta ($/milhão) para que sejam comparáveis, o que é bom o suficiente para dimensionar um orçamento, mas não uma cotação. Os níveis gratuitos (Pinecone Starter, cluster gratuito Zilliz, Qdrant 1 GB gratuito) não são subtraídos. Confirme na página de preços de cada provedor antes de se comprometer. · Informar preço desatualizado →

Como o número de armazenamento é construído

Cada vetor é uma matriz de pontos flutuantes de 32 bits, portanto, uma única incorporação de 1536 dimensões é aproximadamente 6KB bruto (1536 × 4 bytes). Multiplique pela contagem de vetores para a carga útil bruta e adicione aproximadamente 50% de despesas gerais para a estrutura do índice HNSW/FIV e metadados que todo armazenamento sério de vetores mantém junto com os vetores brutos. Esse é o valor do “armazenamento indexado” acima – aquilo pelo qual todo provedor cobra, quer o chamem de armazenamento, pod ou tamanho de cluster. Dobrar a dimensão (1536 → 3072) duplica esse número para a mesma contagem de vetores, e é por isso que "maior incorporação = melhor" não é uma escolha livre.

Por que os fornecedores têm preços tão diferentes

Pinha e Nuvem Zilliz são baseados em uso sem servidor: você paga pelos GB armazenados mais unidades de leitura e gravação, portanto, um endpoint RAG com muita leitura pode custar mais do que seu armazenamento sugere. Nuvem Qdrant e Tecer Nuvem estão mais próximos dos baseados em computação/RAM — você escolhe um tamanho de cluster que deve conter o índice na memória, de modo que o custo rastreia mais o armazenamento do que as consultas. vetor pg é apenas uma extensão dentro do Postgres: se você já executa um banco de dados, adicionar vetores é quase gratuito até que o índice ultrapasse a RAM, momento em que você paga por uma caixa maior. A calculadora nivela tudo isso em um formato de armazenamento + consulta para que você possa comparar a ordem de magnitude e, em seguida, confirmar a fatura exata no provedor escolhido.

Como manter a conta baixa

Armazene menos pedaços melhores, em vez de cada parágrafo duas vezes. Use uma dimensão de incorporação menor quando o recall permitir – 768-d geralmente corresponde a 1536-d em domínios estreitos com metade do armazenamento. Elimine vetores obsoletos em vez de deixar o índice crescer para sempre. E lembre-se do lado da leitura: armazenar em cache as consultas frequentes e o contexto LLM em torno delas é onde está o dinheiro real. Combine isso com o calculadora de economia de cache imediata e, se você estiver dimensionando todo um pipeline de recuperação, o calculadora de custos do chatbot ou o completo Estimador de custos de aplicativos de IA.

Escolhendo incorporações? O OpenAI e Gêmeos guias listam os preços atuais de incorporação e o Calculadora de custos do agente de IA cobre agentes de recuperação aumentada de ponta a ponta.

Hospede seu projeto:DigitalOcean – $ 200 grátis ↗VPS da Hostinger
Custo de memória do agente AI (Mem0 vs Zep)Calculadora de custos de reintegração da base de conhecimentoCusto do teste LLM A/BCalculadora de custo de token LLMContador de fichasEconomia imediata de compactação