Come funziona questa calcolatrice
IL Calcolatore dei costi di RAG Chatbot stima i costi di gestione di un chatbot potenziato per il recupero per query E al mese. Inserisci il tuo query al mese, IL token di contesto recuperati ogni query inserisce, il gettoni di risposta il modello genera e i tuoi LLM ingresso E produzione prezzi per milione di token. Moltiplica i token di contesto per la velocità di input e i token di risposta per la velocità di output per ottenere un costo per query, quindi lo ridimensiona in base al volume mensile. Il driver più grande è solitamente il contesto recuperato: ogni blocco che alleghi viene fatturato come input each chiamata, quindi la dimensione del recupero e il volume delle query dominano il conto più della lunghezza della risposta.
Il compromesso chiave è quanto contesto recuperi. Un maggior numero di blocchi recuperati può migliorare la qualità della risposta, ma poiché il contesto viene reinviato e rifatturato a ogni query, raddoppiandolo si raddoppia all'incirca il costo di input su larga scala. Prova a ridurre il numero o la dimensione dei passaggi recuperati e osserva come si muove la cifra mensile: spesso puoi ridurre sostanzialmente il contesto con una minima perdita di qualità. Perché produzione i token hanno solitamente un prezzo più alto per token ma molto meno in numero, il controllo delle risposte dettagliate aiuta meno del controllo del contesto. Utilizza la calcolatrice per trovare il punto in cui il recupero è sufficientemente ampio per rispondere correttamente, ma non così elevato da far sì che il costo cresca più rapidamente del valore fornito da ciascuna query.
Domande frequenti
Quanto costa un chatbot RAG per query?
Each RAG query pays for an embedding of the question, a vector-database lookup, and the LLM call that includes the retrieved chunks as context. The LLM input (your retrieved context can be thousands of tokens) usually dominates; embeddings and the vector query are cents or less.
Come posso tagliare i costi RAG?
Recupera porzioni sempre più piccole, memorizza nella cache il prompt del sistema, utilizza un modello più economico per le risposte di routine e memorizza nella cache gli incorporamenti per le query ripetute. La dimensione del contesto recuperato è la principale leva di costo.