28 de julho de 2026 · IA e LLMs · 6 min de leitura
Incorporei todo um conjunto de documentação no mês passado – cerca de 50 milhões de tokens de texto – e o projeto de lei da OpenAI chegou a um dólar. Um único dólar. Na verdade, reli a fatura porque tinha certeza de que havia perdido uma casa decimal. As incorporações são a coisa mais barata em toda a pilha de IA, tão baratas que comparar os provedores apenas pela taxa de incorporação é quase inútil. O número que realmente vai te machucar está em outro lugar, e eu irei atendê-lo. Mas primeiro, os preços reais, porque as pessoas ainda perguntam.
Estas são as taxas de entrada pré-pagas que acompanho. Os embeddings cobram apenas pela entrada - você envia texto, recebe vetores de volta, não há nenhum lado "token de saída" na fatura. Tudo abaixo equivale a dólares por um milhão de tokens de texto incorporados.
| Modelo | Preço / 1 milhão de tokens | Dimensões | Notas |
|---|---|---|---|
| OpenAI text-embedding-3-small | $0.02 | 1536 | The default value pick |
| Viagem-3-lite | $0.02 | 512 | Vetores baratos + minúsculos |
| Voyage-3 | $0.06 | 1024 | Qualidade de recuperação forte |
| Cohere Incorporar v3 | $0.10 | 1024 | Bom multilíngue |
| Incorporação Mistral | $0.10 | 1024 | Opção hospedada na UE |
| Incorporação de texto OpenAI-3-grande | $0.13 | 3072 | Melhor qualidade OpenAI |
| Google gemini-incorporação-001 | $0.15 | 3072 | Nível gratuito generoso primeiro |
O spread do mais barato para o mais caro é aproximadamente 7× – $ 0,02 a $ 0,15. Isso parece dramático até que você multiplique por um corpus realista e veja quão pequenos os números absolutos permanecem.
Aqui está o custo único para incorporar três tamanhos de corpus. 50M tokens é um site de documentos ou base de conhecimento de tamanho médio. 200M é o centro de ajuda completo de um grande produto, além do histórico. 1B é de escala empresarial – pense em todos os tickets de suporte que você já preencheu.
| Corpus | 3-pequeno / Voyage-lite | Voyage-3 | Cohere / Mistral | 3-grande | Gêmeos |
|---|---|---|---|---|---|
| 50 milhões de tokens | $1.00 | $3.00 | $5.00 | $6.50 | $7.50 |
| 200 milhões de tokens | $4.00 | $12.00 | $20.00 | $26.00 | $30.00 |
| Tokens 1B | $20.00 | $60.00 | $100.00 | $130.00 | $150.00 |
Mesmo com um bilhão de tokens, a opção mais cara aqui é de US$ 150 — uma vez. Seu lado de consulta é ainda mais barato: um aplicativo RAG que incorpora um milhão de perguntas de usuários por mês a cerca de 80 tokens cada, queima 80 milhões de tokens, o que custa US$ 1,60 no 3-small. Nunca vi o item de linha de incorporação quebrar nem mesmo 2% da fatura mensal de um produto de IA. Então, por que alguém se importa com qual você escolhe?
Olhe novamente para a coluna de dimensões. Esse é o número que realmente custa dinheiro, e custa todo mês, não uma vez. Um banco de dados vetorial cobra de você armazenar e pesquisar esses vetores e as escalas de preços com quantas dimensões cada um possui. text-embedding-3-large produz Dimensão 3072 vetores. Voyage-3-lite produz 512. Isso é um 6× diferença em armazenamento e memória exatamente para os mesmos documentos.
Portanto, o modelo “premium” de US$ 0,13 não custa apenas 6× mais para incorporar – pode custar várias vezes mais para hospedar, para sempre. Em um banco de dados de vetores gerenciado, alguns milhões de vetores de 3072 dims armazenados na memória são um item de linha mensal real, enquanto o mesmo corpus com 512 dims pode caber em uma camada livre ou quase livre. A API de incorporação é um erro de arredondamento. O índice que ele alimenta é a cobrança recorrente. Eu avaliei o lado do armazenamento separadamente no Análise de pinha vs pgvector - é aí que o dinheiro realmente mora.
Incorporações de diferentes modelos são não compatível. Um vetor da OpenAI não significa nada para um índice Cohere. Portanto, no dia em que você decidir trocar de provedor - ou até mesmo atualizar de 3 pequenos para 3 grandes - você terá que reincorpore todo o seu corpus do zero e reconstrua o índice. Esse trabalho de US$ 1 é barato para ser executado uma vez; é chato de executar porque você trocou de modelo seis meses depois e agora todo vetor armazenado é lixo.
É por isso que a jogada inteligente não é “escolher o mais barato por token”. É "escolher um modelo cuja contagem de dimensões seu banco de dados vetorial possa hospedar e cuja qualidade de recuperação seja boa o suficiente para que você nunca precise reincorporá-la". Para a maioria das pessoas, a resposta é text-embedding-3-small ou Voyage-3-lite: dois centavos por milhão de tokens, pequenos vetores, qualidade que se mantém. Você alcança 3 grandes ou um reclassificador somente quando a qualidade da recuperação está falhando mensuravelmente, não por padrão.
Eu padrão para incorporação de texto-3-pequeno. Custa US$ 0,02/1 milhão, os vetores têm 1.536 dimensões gerenciáveis e o OpenAI permite encurtá-los ainda mais se seu banco de dados estiver com pouca memória. Quando preciso de uma melhor recuperação multilíngue, testo o Voyage ou o Cohere em meu próprio conjunto de avaliação antes de confirmar - porque mudar mais tarde significa incorporar tudo novamente. E orçamento o banco de dados vetorial como o custo real, não a API. Execute seus próprios números antes de se comprometer com uma contagem de dimensões que você terá que pagar todos os meses:
Novo em preços de API baseados no uso? Comece com o guias gratuitos de custo de API. E se você estiver criando o aplicativo de recuperação completo, os embeddings são o terceiro mais barato – consulte quanto custa o lado LLM após o armazenamento em cache para saber para onde vai o dinheiro real por chamada.
Os preços são taxas de lista de fornecedores monitoradas em nosso catálogo (julho de 2026) e são estimativas de referência – confirme as taxas atuais na página de preços de cada fornecedor antes de fazer o orçamento. As contagens de dimensões são saídas padrão do modelo; alguns modelos (incluindo OpenAI) suportam encurtamento. Os custos do Corpus são únicos; o armazenamento de banco de dados vetorial é recorrente e cobrado separadamente.