28 luglio 2026 · AI e LLM · 6 minuti di lettura
Il mese scorso ho incorporato un intero set di documentazione - circa 50 milioni di token di testo - e il disegno di legge OpenAI è arrivato un dollaro. A single dollar. I actually re-read the invoice because I was sure I had dropped a decimal. Embeddings are the cheapest thing in the entire AI stack, so cheap that comparing providers on the embedding rate alone is almost pointless. The number that will actually hurt you is somewhere else, and I will get to it. But first, the real prices, because people still ask.
Queste sono le tariffe di input a consumo che tengo traccia. Gli incorporamenti addebitano solo l'input: invii testo, ricevi indietro i vettori, non c'è un lato "token di output" nella fattura. Tutto ciò che segue equivale a dollari per milione di token di testo incorporato.
| Modello | Prezzo / 1 milione di token | Dimensioni | Note |
|---|---|---|---|
| OpenAI text-embedding-3-small | $0.02 | 1536 | La scelta del valore predefinito |
| Viaggio-3-lite | $0.02 | 512 | Vettori economici + minuscoli |
| Viaggio-3 | $0.06 | 1024 | Forte qualità di recupero |
| Cohere Incorpora v3 | $0.10 | 1024 | Buono multilingue |
| Incorporamento maestrale | $0.10 | 1024 | Opzione ospitata nell'UE |
| OpenAI text-embedding-3-large | $0.13 | 3072 | La migliore qualità OpenAI |
| Google gemini-embedding-001 | $0.15 | 3072 | Primo livello gratuito generoso |
Lo spread dal più economico al più costoso è approssimativamente 7× — Da $ 0,02 a $ 0,15. Sembra drammatico finché non lo moltiplichi per un corpus realistico e vedi quanto piccoli rimangono i numeri assoluti.
Di seguito è riportato il costo una tantum per incorporare tre dimensioni di corpus. I token da 50 milioni sono un sito di documenti o una knowledge base di medie dimensioni. 200M è l'intero centro assistenza di un grande prodotto più la cronologia. 1B è su scala aziendale: pensa a ogni ticket di supporto che hai presentato.
| Corpo | 3-piccolo / Voyage-lite | Viaggio-3 | Cohe/Maestrale | 3-grande | Gemelli |
|---|---|---|---|---|---|
| 50M tokens | $1.00 | $3.00 | $5.00 | $6.50 | $7.50 |
| 200 milioni di gettoni | $4.00 | $12.00 | $20.00 | $26.00 | $30.00 |
| 1B tokens | $20.00 | $60.00 | $100.00 | $130.00 | $150.00 |
Anche a un miliardo di token, l’opzione più costosa qui è $ 150 – una volta. Il lato delle query è ancora più economico: un'app RAG che incorpora un milione di domande degli utenti al mese a ~80 token ciascuna brucia 80 milioni di token, ovvero $ 1,60 su 3-small. Non ho mai visto l'elemento pubblicitario incorporato incidere nemmeno del 2% sulla fattura mensile di un prodotto AI. Allora perché a qualcuno interessa quale scegli?
Look back at the dimensions column. That is the number that actually costs money, and it costs it every single month, not once. A vector database charges you to archiviare e cercare those vectors, and the price scales with how many dimensions each one has. text-embedding-3-large produces 3072-dimensione vettori. Voyage-3-lite produce 512. Questo è un Differenza 6× in termini di spazio di archiviazione e memoria per gli stessi identici documenti.
Quindi il modello “premium” da 0,13 dollari non solo costa 6 volte di più da incorporare, ma può costare molte volte di più da integrare. ospite, per sempre. Su un DB vettoriale gestito, alcuni milioni di vettori da 3072 dim presenti in memoria costituiscono un vero e proprio elemento pubblicitario mensile, mentre lo stesso corpus da 512 dim potrebbe rientrare in un livello gratuito o quasi libero. L'API di incorporamento è un errore di arrotondamento. L'indice che alimenta è l'addebito ricorrente. Ho valutato il lato portaoggetti separatamente nel Ripartizione Pinecone vs pgvettoriale – è lì che vivono effettivamente i soldi.
Sono incorporamenti di diversi modelli non compatibile. Un vettore di OpenAI non significa nulla per un indice Cohere. Quindi, il giorno in cui decidi di cambiare fornitore, o addirittura di passare da 3-small a 3-large, devi farlo reintegrare l'intero corpus da zero and rebuild the index. That $1 job is cheap to run once; it is annoying to run because you swapped models six months in and now every stored vector is garbage.
Questo è il motivo per cui la mossa intelligente non è "scegliere il gettone più economico". Si tratta di "scegliere un modello le cui dimensioni contano il tuo DB vettoriale può permettersi di ospitare e la cui qualità di recupero è sufficientemente buona da non dover mai essere reintegrato". Per la maggior parte delle persone la risposta è text-embedding-3-small o Voyage-3-lite: due centesimi per milione di token, vettori piccoli, qualità che regge. Raggiungi 3-large o un reranker solo quando la qualità del recupero fallisce in modo misurabile, non per impostazione predefinita.
Per impostazione predefinita incorporamento del testo-3-piccolo. È $ 0,02/1 milione, i vettori hanno 1536 dimensioni gestibili e OpenAI ti consente di accorciarli ulteriormente se il tuo DB ha poca memoria. Quando ho bisogno di un migliore richiamo multilingue, provo Voyage o Cohere sul mio set di valutazione prima di impegnarmi, perché cambiare in seguito significa incorporare nuovamente tutto. E prevedo il costo reale del database vettoriale, non dell'API. Esegui i tuoi numeri prima di impegnarti in un conteggio di dimensioni per cui devi pagare ogni mese:
Sei nuovo ai prezzi API basati sull'utilizzo? Inizia con il guide gratuite sui costi API. E se stai creando l'app di recupero completa, gli incorporamenti sono il terzo economico: vedi quanto costa il lato LLM dopo la memorizzazione nella cache per dove va a finire il vero denaro per chiamata.
I prezzi sono tariffe di listino dei fornitori tracciate nel nostro catalogo (luglio 2026) e sono stime di riferimento: conferma le tariffe attuali sulla pagina dei prezzi di ciascun fornitore prima di stabilire il budget. I conteggi delle dimensioni sono output del modello predefinito; alcuni modelli (incluso OpenAI) supportano l'accorciamento. I costi del corpus sono una tantum; L'archiviazione del database vettoriale è ricorrente e fatturata separatamente.