HomeBlog › Confronto dei costi dell'API di incorporamento

Quanto costano effettivamente gli incorporamenti: OpenAI vs Cohere vs Voyage vs Gemini (2026)

28 luglio 2026 · AI e LLM · 6 minuti di lettura

Il mese scorso ho incorporato un intero set di documentazione - circa 50 milioni di token di testo - e il disegno di legge OpenAI è arrivato un dollaro. A single dollar. I actually re-read the invoice because I was sure I had dropped a decimal. Embeddings are the cheapest thing in the entire AI stack, so cheap that comparing providers on the embedding rate alone is almost pointless. The number that will actually hurt you is somewhere else, and I will get to it. But first, the real prices, because people still ask.

I prezzi reali del 2026, per 1 milione di token

Queste sono le tariffe di input a consumo che tengo traccia. Gli incorporamenti addebitano solo l'input: invii testo, ricevi indietro i vettori, non c'è un lato "token di output" nella fattura. Tutto ciò che segue equivale a dollari per milione di token di testo incorporato.

ModelloPrezzo / 1 milione di tokenDimensioniNote
OpenAI text-embedding-3-small$0.021536La scelta del valore predefinito
Viaggio-3-lite$0.02512Vettori economici + minuscoli
Viaggio-3$0.061024Forte qualità di recupero
Cohere Incorpora v3$0.101024Buono multilingue
Incorporamento maestrale$0.101024Opzione ospitata nell'UE
OpenAI text-embedding-3-large$0.133072La migliore qualità OpenAI
Google gemini-embedding-001$0.153072Primo livello gratuito generoso

Lo spread dal più economico al più costoso è approssimativamente — Da $ 0,02 a $ 0,15. Sembra drammatico finché non lo moltiplichi per un corpus realistico e vedi quanto piccoli rimangono i numeri assoluti.

Quanto costa incorporare un corpus reale

Di seguito è riportato il costo una tantum per incorporare tre dimensioni di corpus. I token da 50 milioni sono un sito di documenti o una knowledge base di medie dimensioni. 200M è l'intero centro assistenza di un grande prodotto più la cronologia. 1B è su scala aziendale: pensa a ogni ticket di supporto che hai presentato.

Corpo3-piccolo / Voyage-liteViaggio-3Cohe/Maestrale3-grandeGemelli
50M tokens$1.00$3.00$5.00$6.50$7.50
200 milioni di gettoni$4.00$12.00$20.00$26.00$30.00
1B tokens$20.00$60.00$100.00$130.00$150.00

Anche a un miliardo di token, l’opzione più costosa qui è $ 150 – una volta. Il lato delle query è ancora più economico: un'app RAG che incorpora un milione di domande degli utenti al mese a ~80 token ciascuna brucia 80 milioni di token, ovvero $ 1,60 su 3-small. Non ho mai visto l'elemento pubblicitario incorporato incidere nemmeno del 2% sulla fattura mensile di un prodotto AI. Allora perché a qualcuno interessa quale scegli?

Il vero conto è il database vettoriale

Look back at the dimensions column. That is the number that actually costs money, and it costs it every single month, not once. A vector database charges you to archiviare e cercare those vectors, and the price scales with how many dimensions each one has. text-embedding-3-large produces 3072-dimensione vettori. Voyage-3-lite produce 512. Questo è un Differenza 6× in termini di spazio di archiviazione e memoria per gli stessi identici documenti.

Quindi il modello “premium” da 0,13 dollari non solo costa 6 volte di più da incorporare, ma può costare molte volte di più da integrare. ospite, per sempre. Su un DB vettoriale gestito, alcuni milioni di vettori da 3072 dim presenti in memoria costituiscono un vero e proprio elemento pubblicitario mensile, mentre lo stesso corpus da 512 dim potrebbe rientrare in un livello gratuito o quasi libero. L'API di incorporamento è un errore di arrotondamento. L'indice che alimenta è l'addebito ricorrente. Ho valutato il lato portaoggetti separatamente nel Ripartizione Pinecone vs pgvettoriale – è lì che vivono effettivamente i soldi.

La trappola da cui nessuno ti avverte

Sono incorporamenti di diversi modelli non compatibile. Un vettore di OpenAI non significa nulla per un indice Cohere. Quindi, il giorno in cui decidi di cambiare fornitore, o addirittura di passare da 3-small a 3-large, devi farlo reintegrare l'intero corpus da zero and rebuild the index. That $1 job is cheap to run once; it is annoying to run because you swapped models six months in and now every stored vector is garbage.

Questo è il motivo per cui la mossa intelligente non è "scegliere il gettone più economico". Si tratta di "scegliere un modello le cui dimensioni contano il tuo DB vettoriale può permettersi di ospitare e la cui qualità di recupero è sufficientemente buona da non dover mai essere reintegrato". Per la maggior parte delle persone la risposta è text-embedding-3-small o Voyage-3-lite: due centesimi per milione di token, vettori piccoli, qualità che regge. Raggiungi 3-large o un reranker solo quando la qualità del recupero fallisce in modo misurabile, non per impostazione predefinita.

Quello che faccio realmente

Per impostazione predefinita incorporamento del testo-3-piccolo. È $ 0,02/1 milione, i vettori hanno 1536 dimensioni gestibili e OpenAI ti consente di accorciarli ulteriormente se il tuo DB ha poca memoria. Quando ho bisogno di un migliore richiamo multilingue, provo Voyage o Cohere sul mio set di valutazione prima di impegnarmi, perché cambiare in seguito significa incorporare nuovamente tutto. E prevedo il costo reale del database vettoriale, non dell'API. Esegui i tuoi numeri prima di impegnarti in un conteggio di dimensioni per cui devi pagare ogni mese:

Sei nuovo ai prezzi API basati sull'utilizzo? Inizia con il guide gratuite sui costi API. E se stai creando l'app di recupero completa, gli incorporamenti sono il terzo economico: vedi quanto costa il lato LLM dopo la memorizzazione nella cache per dove va a finire il vero denaro per chiamata.

I prezzi sono tariffe di listino dei fornitori tracciate nel nostro catalogo (luglio 2026) e sono stime di riferimento: conferma le tariffe attuali sulla pagina dei prezzi di ciascun fornitore prima di stabilire il budget. I conteggi delle dimensioni sono output del modello predefinito; alcuni modelli (incluso OpenAI) supportano l'accorciamento. I costi del corpus sono una tantum; L'archiviazione del database vettoriale è ricorrente e fatturata separatamente.