—per query
—indicizzazione una tantum
—costo mensile più alto
Modello di risposta più economico per questo RAG
Stesso recupero e traffico, ogni modello classificato in base al costo mensile.
| Modello | Costo/mese | Per query |
|---|
⚠️ Preventivo modificabile utilizzando i prezzi di riferimento (luglio 2026). Il costo del DB vettoriale varia notevolmente in base al fornitore e al piano: imposta il tuo. Le fatture reali cambiano anche con la riclassificazione, la memorizzazione nella cache, il filtraggio dei metadati e la frequenza di reindicizzazione. ·
Segnala prezzo obsoleto →
Dove vanno effettivamente i soldi RAG
Le persone presumono che gli incorporamenti siano la parte costosa di RAG. Di solito sono i più economici. Incorporare 10.000 documenti brevi costa spesso pochi centesimi, pagati una volta. Il costo reale e ricorrente è il LLM su ogni query - e in particolare il contesto recuperato gli dai da mangiare. Estrai 5 blocchi da 400 token e avrai aggiunto 2.000 token di input a ogni singola domanda prima ancora che l'utente finisca di digitare. Moltiplica per il volume delle tue query e questa sarà la tua fattura.
Le grandi leve, in ordine: recupero pezzi in meno/più piccoli (top-k e dimensione del blocco), utilizzare a modello di risposta più economico per le query di routine e la lunghezza massima delle risposte. Il re-incorporamento solo dei documenti modificati (non dell'intero corpus) evita che il costo una tantum si ripeta. Costruire il resto dell'app? Valuta un bot di supporto con il file calcolatore dei costi del chatbot, un'intera funzionalità con il Stima dei costi delle app AI, or the full backend with the Calcolatore dei costi dello stack API. Basta dimensionare il livello di archiviazione? Vedi il calcolatore dei costi del database vettoriale per Pigna vs Qdrant vs pgvettoriale.
BinanceTwilioGoogle GemelliCoinGeckoAI e LLM
Come funziona questa calcolatrice
IL Calcolatore dei costi RAG stima il costo mensile di gestione di una pipeline di generazione potenziata con recupero combinando tre fatture separate. Innanzitutto, calcola a costo di incorporamento una tantum from your document count, average tokens per document, and chunk size, priced by the selected embedding model. Second, it accounts for the vector database that stores those chunk embeddings. Third, and usually the largest, it computes the recurring Costo LLM per query: il volume della tua query mensile moltiplicato per i token di input dei blocchi recuperati (top-k) più la lunghezza della risposta generata, valutata in base al modello di risposta scelto. Il volume delle query, top-k e il modello di risposta sono i fattori principali.
Guarda il impostazione di recupero top-k da vicino. Ogni blocco recuperato viene aggiunto al prompt di ogni query, quindi l'aumento della dimensione top-k o del blocco gonfia direttamente i token di input su ogni interrogazione per tutto il mese. Il recupero di più contesto può migliorare la qualità delle risposte, ma il costo varia in modo lineare con le query. Un consiglio pratico: recuperare meno parti più strette e riservare un modello di risposta più ampio e più costoso solo dove la precisione lo giustifica. L'incorporamento è un costo iniziale fisso, mentre la fattura LLM per query aumenta con l'utilizzo, quindi ottimizza prima il percorso della query.
Domande frequenti
Da cosa dipende il costo di un sistema RAG?
Tre parti. Una volta: incorpora tutti i tuoi documenti in vettori. Mensile in corso: il database dei vettori che archivia e ricerca tali vettori, più il costo LLM per query, che include i blocchi recuperati che inserisci nel prompt come contesto. Per la maggior parte delle app RAG prevale il costo LLM per query, poiché il contesto recuperato può essere molto più ampio della domanda effettiva dell'utente.
Perché il contesto recuperato è il costo RAG maggiore?
Ogni query invia i primi k blocchi recuperati al modello come token di input. Recupera 5 blocchi da 400 token e pagherai 2.000 token di input per query prima che l'utente abbia detto molto. Recuperare un numero inferiore o più piccolo di blocchi o utilizzare un modello più economico riduce i costi molto di più rispetto alla modifica dei modelli di incorporamento.