Uma conta DB vetorial vem de três números, não do modelo. Quantos vetores você mantém, qual a largura de cada um (sua dimensão) e quantas consultas você executa. Tudo abaixo é derivado desses três - o armazenamento é vectors × dimension × 4 bytes além de sobrecarga de índice e escalas de custo de consulta com volume de leitura.
Custo mensal por provedor
Mesma carga de trabalho, classificada como mais barata em primeiro lugar. Estimativa de armazenamento + consulta, antes de qualquer nível gratuito.
| Provedor | Modelo | Husa. / mês |
|---|
Como o número de armazenamento é construído
Cada vetor é uma matriz de pontos flutuantes de 32 bits, portanto, uma única incorporação de 1536 dimensões é aproximadamente 6KB bruto (1536 × 4 bytes). Multiplique pela contagem de vetores para a carga útil bruta e adicione aproximadamente 50% de despesas gerais para a estrutura do índice HNSW/FIV e metadados que todo armazenamento sério de vetores mantém junto com os vetores brutos. Esse é o valor do “armazenamento indexado” acima – aquilo pelo qual todo provedor cobra, quer o chamem de armazenamento, pod ou tamanho de cluster. Dobrar a dimensão (1536 → 3072) duplica esse número para a mesma contagem de vetores, e é por isso que "maior incorporação = melhor" não é uma escolha livre.
Por que os fornecedores têm preços tão diferentes
Pinha e Nuvem Zilliz são baseados em uso sem servidor: você paga pelos GB armazenados mais unidades de leitura e gravação, portanto, um endpoint RAG com muita leitura pode custar mais do que seu armazenamento sugere. Nuvem Qdrant e Tecer Nuvem estão mais próximos dos baseados em computação/RAM — você escolhe um tamanho de cluster que deve conter o índice na memória, de modo que o custo rastreia mais o armazenamento do que as consultas. vetor pg é apenas uma extensão dentro do Postgres: se você já executa um banco de dados, adicionar vetores é quase gratuito até que o índice ultrapasse a RAM, momento em que você paga por uma caixa maior. A calculadora nivela tudo isso em um formato de armazenamento + consulta para que você possa comparar a ordem de magnitude e, em seguida, confirmar a fatura exata no provedor escolhido.
Como manter a conta baixa
Armazene menos pedaços melhores, em vez de cada parágrafo duas vezes. Use uma dimensão de incorporação menor quando o recall permitir – 768-d geralmente corresponde a 1536-d em domínios estreitos com metade do armazenamento. Elimine vetores obsoletos em vez de deixar o índice crescer para sempre. E lembre-se do lado da leitura: armazenar em cache as consultas frequentes e o contexto LLM em torno delas é onde está o dinheiro real. Combine isso com o calculadora de economia de cache imediata e, se você estiver dimensionando todo um pipeline de recuperação, o calculadora de custos do chatbot ou o completo Estimador de custos de aplicativos de IA.
Escolhendo incorporações? O OpenAI e Gêmeos guias listam os preços atuais de incorporação e o Calculadora de custos do agente de IA cobre agentes de recuperação aumentada de ponta a ponta.