Die Kosten eines RAG-Chatbots werden durch den abgerufenen Kontext bestimmt, den Sie in die Eingabeaufforderung einfügen, nicht die Frage. Jede Abfrage = Einbettung + Vektorsuche + ein LLM-Aufruf, der Ihre Chunks überträgt. Geben Sie Ihren Verbrauch ein, um die monatliche Rechnung anzuzeigen.
—pro Anfrage
—pro Jahr
—Anfragen/Mo
Kostenaufschlüsselung pro Abfrage
| Komponente | $ / Abfrage | % der Gesamtmenge |
|---|
⚠️ Referenzschätzungen (Juli 2026). Das Einbetten von Token im Wert von ca. 0,02 $/1 Mio. und eine Vektorabfrage sind neben dem LLM-Aufruf, der den abgerufenen Kontext überträgt, nur geringfügig. Die Preise variieren je nach Modell und Anbieter – geben Sie Ihre tatsächlichen Preise ein. Vector DB-Speicher wird separat in Rechnung gestellt (siehe Kostenrechner für Vector-Datenbanken). ·
Veralteten Preis melden →
Warum der abgerufene Kontext der Kostentreiber ist
Es wird angenommen, dass die Frage die RAG-Kosten bestimmt. Das ist nicht der Fall abgerufene Brocken Sie fügen es in die Eingabeaufforderung ein. Rufen Sie 8 Blöcke mit 500 Token ab und jede Abfrage enthält 4.000 Eingabetoken, bevor das Modell ein Wort schreibt. Deshalb Es werden weniger, kleinere und bessere Brocken gewonnen übertrifft jede andere Optimierung, gefolgt von Caching die statische Systemaufforderung. Bestimmen Sie die Größe des Vektorspeichers mit dem Kostenrechner für Vektordatenbanken, und vergleichen Sie Modelle auf der KI-API-Kostenrechner. Informationen zu einem Nicht-RAG-Bot finden Sie im Chatbot-Kostenrechner.
Rechner für bereitgestellten Durchsatz (PTU).Multi-Turn-GesprächskostenrechnerAI Gateway Markup-RechnerPreisrechner für Sitzplatz vs. NutzungKostenkalkulator für KI-Apps
So funktioniert dieser Rechner
Schätzen Sie, was ein RAG-Chatbot pro Anfrage und pro Monat kostet – Einbettungen, Vektorabruf und der LLM-Aufruf, der Ihren Kontext überträgt.
Häufig gestellte Fragen
Was kostet ein RAG-Chatbot pro Anfrage?
Bei jeder RAG-Abfrage werden Kosten für die Einbettung der Frage, eine Vektordatenbanksuche und den LLM-Aufruf verursacht, der die abgerufenen Blöcke als Kontext einschließt. Die LLM-Eingabe (Ihr abgerufener Kontext kann Tausende von Token umfassen) dominiert normalerweise; Einbettungen und die Vektorabfrage kosten Cent oder weniger.
Wie reduziere ich die RAG-Kosten?
Rufen Sie weniger und kleinere Blöcke ab, speichern Sie die Systemeingabeaufforderung zwischen, verwenden Sie ein günstigeres Modell für Routineantworten und speichern Sie Einbettungen für wiederholte Abfragen zwischen. Die abgerufene Kontextgröße ist der größte Kostenhebel.