Come funziona questa calcolatrice
IL Calcolatore dei costi di RAG Chatbot stima i costi di gestione di un chatbot potenziato per il recupero per query E al mese. Inserisci il tuo query al mese, IL token di contesto recuperati ogni query inserisce, il gettoni di risposta il modello genera e i tuoi LLM ingresso E produzione prezzi per milione di token. Moltiplica i token di contesto per la velocità di input e i token di risposta per la velocità di output per ottenere un costo per query, quindi lo ridimensiona in base al volume mensile. Il driver più grande è solitamente il contesto recuperato: ogni blocco che alleghi viene fatturato come input ogni chiamata, quindi la dimensione del recupero e il volume delle query dominano il conto più della lunghezza della risposta.
Il compromesso chiave è quanto contesto recuperi. Un maggior numero di blocchi recuperati può migliorare la qualità della risposta, ma poiché il contesto viene reinviato e rifatturato a ogni query, raddoppiandolo si raddoppia all'incirca il costo di input su larga scala. Prova a ridurre il numero o la dimensione dei passaggi recuperati e osserva come si muove la cifra mensile: spesso puoi ridurre sostanzialmente il contesto con una minima perdita di qualità. Perché produzione i token hanno solitamente un prezzo più alto per token ma molto meno in numero, il controllo delle risposte dettagliate aiuta meno del controllo del contesto. Utilizza la calcolatrice per trovare il punto in cui il recupero è sufficientemente ampio per rispondere correttamente, ma non così elevato da far sì che il costo cresca più rapidamente del valore fornito da ciascuna query.
Domande frequenti
Quanto costa un chatbot RAG per query?
Ogni query RAG paga per l'incorporamento della domanda, una ricerca nel database vettoriale e la chiamata LLM che include i blocchi recuperati come contesto. L'input LLM (il contesto recuperato può essere composto da migliaia di token) di solito domina; gli incorporamenti e la query vettoriale costano centesimi o meno.
Come posso tagliare i costi RAG?
Recupera porzioni sempre più piccole, memorizza nella cache il prompt del sistema, utilizza un modello più economico per le risposte di routine e memorizza nella cache gli incorporamenti per le query ripetute. La dimensione del contesto recuperato è la principale leva di costo.