Die Kosten eines RAG-Chatbots werden durch den abgerufenen Kontext bestimmt, den Sie in die Eingabeaufforderung einfügen, nicht die Frage. Jede Abfrage = Einbettung + Vektorsuche + ein LLM-Aufruf, der Ihre Chunks überträgt. Geben Sie Ihren Verbrauch ein, um die monatliche Rechnung anzuzeigen.

pro Monat
pro Anfrage
pro Jahr
Anfragen/Mo

Kostenaufschlüsselung pro Abfrage

Komponente$ / Abfrage% der Gesamtmenge
⚠️ Referenzschätzungen (Juli 2026). Das Einbetten von Token im Wert von ca. 0,02 $/1 Mio. und eine Vektorabfrage sind neben dem LLM-Aufruf, der den abgerufenen Kontext überträgt, nur geringfügig. Die Preise variieren je nach Modell und Anbieter – geben Sie Ihre tatsächlichen Preise ein. Vector DB-Speicher wird separat in Rechnung gestellt (siehe Kostenrechner für Vector-Datenbanken). · Veralteten Preis melden →

Warum der abgerufene Kontext der Kostentreiber ist

Es wird angenommen, dass die Frage die RAG-Kosten bestimmt. Das ist nicht der Fall abgerufene Brocken Sie fügen es in die Eingabeaufforderung ein. Rufen Sie 8 Blöcke mit 500 Token ab und jede Abfrage enthält 4.000 Eingabetoken, bevor das Modell ein Wort schreibt. Deshalb Es werden weniger, kleinere und bessere Brocken gewonnen übertrifft jede andere Optimierung, gefolgt von Caching die statische Systemaufforderung. Bestimmen Sie die Größe des Vektorspeichers mit dem Kostenrechner für Vektordatenbanken, und vergleichen Sie Modelle auf der KI-API-Kostenrechner. Informationen zu einem Nicht-RAG-Bot finden Sie im Chatbot-Kostenrechner.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Rechner für bereitgestellten Durchsatz (PTU).Multi-Turn-GesprächskostenrechnerAI Gateway Markup-RechnerPreisrechner für Sitzplatz vs. NutzungKostenkalkulator für KI-Apps