al mese (in corso)
per query
indicizzazione una tantum
costo mensile più alto

Modello di risposta più economico per questo RAG

Stesso recupero e traffico, ogni modello classificato in base al costo mensile.

ModelloCosto/mesePer query
⚠️ Preventivo modificabile utilizzando i prezzi di riferimento (luglio 2026). Il costo del DB vettoriale varia notevolmente in base al fornitore e al piano: imposta il tuo. Le fatture reali cambiano anche con la riclassificazione, la memorizzazione nella cache, il filtraggio dei metadati e la frequenza di reindicizzazione. · Segnala prezzo obsoleto →

Dove vanno effettivamente i soldi RAG

Le persone presumono che gli incorporamenti siano la parte costosa di RAG. Di solito sono i più economici. Incorporare 10.000 documenti brevi costa spesso pochi centesimi, pagati una volta. Il costo reale e ricorrente è il LLM su ogni query - e in particolare il contesto recuperato gli dai da mangiare. Estrai 5 blocchi da 400 token e avrai aggiunto 2.000 token di input a ogni singola domanda prima ancora che l'utente finisca di digitare. Moltiplica per il volume delle tue query e questa sarà la tua fattura.

Le grandi leve, in ordine: recupero pezzi in meno/più piccoli (top-k e dimensione del blocco), utilizzare a modello di risposta più economico per le query di routine e la lunghezza massima delle risposte. Il re-incorporamento solo dei documenti modificati (non dell'intero corpus) evita che il costo una tantum si ripeta. Costruire il resto dell'app? Valuta un bot di supporto con il file calcolatore dei costi del chatbot, un'intera funzionalità con il Stima dei costi delle app AI, or the full backend with the Calcolatore dei costi dello stack API. Basta dimensionare il livello di archiviazione? Vedi il calcolatore dei costi del database vettoriale per Pigna vs Qdrant vs pgvettoriale.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
BinanceTwilioGoogle GemelliCoinGeckoAI e LLM