—per query
—indicizzazione una tantum
—costo mensile più alto
Modello di risposta più economico per questo RAG
Stesso recupero e traffico, ogni modello classificato in base al costo mensile.
| Modello | Costo/mese | Per query |
|---|
⚠️ Preventivo modificabile utilizzando i prezzi di riferimento (luglio 2026). Il costo del DB vettoriale varia notevolmente in base al fornitore e al piano: imposta il tuo. Le fatture reali cambiano anche con la riclassificazione, la memorizzazione nella cache, il filtraggio dei metadati e la frequenza di reindicizzazione. ·
Segnala prezzo obsoleto →
Dove vanno effettivamente i soldi RAG
Le persone presumono che gli incorporamenti siano la parte costosa di RAG. Di solito sono i più economici. Incorporare 10.000 documenti brevi costa spesso pochi centesimi, pagati una volta. Il costo reale e ricorrente è il LLM su ogni query - e in particolare il contesto recuperato gli dai da mangiare. Estrai 5 blocchi da 400 token e avrai aggiunto 2.000 token di input a ogni singola domanda prima ancora che l'utente finisca di digitare. Moltiplica per il volume delle tue query e questa sarà la tua fattura. Questo è un semplice RAG vettoriale: se invece stai costruendo un grafico della conoscenza, il passaggio di indicizzazione stesso ha il proprio costo LLM iniziale, valutato separatamente sul Calcolatore dei costi di indicizzazione GraphRAG.
Le grandi leve, in ordine: recupero pezzi in meno/più piccoli (top-k e dimensione del blocco), utilizzare a modello di risposta più economico per le query di routine e la lunghezza massima delle risposte. Il re-incorporamento solo dei documenti modificati (non dell'intero corpus) evita che il costo una tantum si ripeta. Costruire il resto dell'app? Valuta un bot di supporto con il file calcolatore dei costi del chatbot, un'intera funzionalità con il Stima dei costi delle app AIo il backend completo con il file Calcolatore dei costi dello stack API. Basta dimensionare il livello di archiviazione? Vedi il calcolatore dei costi del database vettoriale per Pigna vs Qdrant vs pgvettoriale.
BinanceTwilioGoogle GemelliCoinGeckoAI e LLMCosto del motore di ricerca/risposta AI
Come funziona questa calcolatrice
IL Calcolatore dei costi RAG stima il costo mensile di gestione di una pipeline di generazione aumentata con recupero combinando tre fatture separate. Innanzitutto, calcola a costo di incorporamento una tantum dal conteggio dei documenti, dai token medi per documento e dalla dimensione del blocco, valutati in base al modello di incorporamento selezionato. In secondo luogo, tiene conto del database vettoriale che memorizza gli incorporamenti di blocchi. Il terzo, e solitamente il più grande, calcola il ricorrente Costo LLM per query: il volume della tua query mensile moltiplicato per i token di input dei blocchi recuperati (top-k) più la lunghezza della risposta generata, valutata in base al modello di risposta scelto. Il volume delle query, top-k e il modello di risposta sono i fattori principali.
Guarda il impostazione di recupero top-k da vicino. Ogni blocco recuperato viene aggiunto al prompt di ogni query, quindi l'aumento della dimensione top-k o del blocco gonfia direttamente i token di input su ogni interrogazione per tutto il mese. Il recupero di più contesto può migliorare la qualità delle risposte, ma il costo varia in modo lineare con le query. Un consiglio pratico: recuperare meno parti più strette e riservare un modello di risposta più ampio e più costoso solo dove la precisione lo giustifica. L'incorporamento è un costo iniziale fisso, mentre la fattura LLM per query aumenta con l'utilizzo, quindi ottimizza prima il percorso della query.
Domande frequenti
Da cosa dipende il costo di un sistema RAG?
Tre parti. Una volta: incorpora tutti i tuoi documenti in vettori. Mensile in corso: il database dei vettori che archivia e ricerca tali vettori, più il costo LLM per query, che include i blocchi recuperati che inserisci nel prompt come contesto. Per la maggior parte delle app RAG prevale il costo LLM per query, poiché il contesto recuperato può essere molto più ampio della domanda effettiva dell'utente.
Perché il contesto recuperato è il costo RAG maggiore?
Ogni query invia i primi k blocchi recuperati al modello come token di input. Recupera 5 blocchi da 400 token e pagherai 2.000 token di input per query prima che l'utente abbia detto molto. Il recupero di un numero inferiore o di blocchi più piccoli o l'utilizzo di un modello più economico riducono i costi molto di più rispetto alla modifica dei modelli di incorporamento.