Die Kosten eines RAG-Chatbots werden durch den abgerufenen Kontext bestimmt, den Sie in die Eingabeaufforderung einfügen, nicht die Frage. Jede Abfrage = Einbettung + Vektorsuche + ein LLM-Aufruf, der Ihre Chunks überträgt. Geben Sie Ihren Verbrauch ein, um die monatliche Rechnung anzuzeigen.
—pro Anfrage
—pro Jahr
—Anfragen/Mo
Kostenaufschlüsselung pro Abfrage
| Komponente | $ / Abfrage | % der Gesamtmenge |
|---|
⚠️ Referenzschätzungen (Juli 2026). Das Einbetten von Token im Wert von ca. 0,02 $/1 Mio. und eine Vektorabfrage sind neben dem LLM-Aufruf, der den abgerufenen Kontext überträgt, nur geringfügig. Die Preise variieren je nach Modell und Anbieter – geben Sie Ihre tatsächlichen Preise ein. Vector DB-Speicher wird separat in Rechnung gestellt (siehe Kostenrechner für Vector-Datenbanken). ·
Veralteten Preis melden →
Warum der abgerufene Kontext der Kostentreiber ist
Es wird angenommen, dass die Frage die RAG-Kosten bestimmt. Das ist nicht der Fall abgerufene Brocken Sie fügen es in die Eingabeaufforderung ein. Rufen Sie 8 Blöcke mit 500 Token ab und jede Abfrage enthält 4.000 Eingabetoken, bevor das Modell ein Wort schreibt. Deshalb Es werden weniger, kleinere und bessere Brocken gewonnen übertrifft jede andere Optimierung, gefolgt von Caching die statische Systemaufforderung. Bestimmen Sie die Größe des Vektorspeichers mit dem Kostenrechner für Vektordatenbanken, und vergleichen Sie Modelle auf der KI-API-Kostenrechner. Informationen zu einem Nicht-RAG-Bot finden Sie im Chatbot-Kostenrechner.
Rechner für bereitgestellten Durchsatz (PTU).Multi-Turn-GesprächskostenrechnerAI Gateway Markup-RechnerPreisrechner für Sitzplatz vs. NutzungKostenkalkulator für KI-Apps
So funktioniert dieser Rechner
Der RAG Chatbot-Kostenrechner schätzt, was der Betrieb eines Chatbots mit Abrufunterstützung kostet pro Anfrage Und pro Monat. Sie geben Ihre ein Anfragen pro Monat, Die abgerufene Kontext-Tokens Jede Abfrage zieht ein Antwort-Token das Modell generiert, und Ihre LLMs Eingang Und Ausgabe Preise pro Million Token. Es multipliziert Kontext-Tokens mit der Eingaberate und Antwort-Tokens mit der Ausgaberate, um die Kosten pro Abfrage zu erhalten, und skaliert diese dann nach dem monatlichen Volumen. Der größte Treiber ist normalerweise der abgerufene Kontext: Jeder von Ihnen angehängte Block wird als Eingabe abgerechnet jede Anruf, daher dominieren die Abrufgröße und das Abfragevolumen die Rechnung mehr als die Antwortlänge.
Der wichtigste Kompromiss ist wie viel Kontext Sie abrufen. Mehr abgerufene Blöcke können die Antwortqualität verbessern, aber da dieser Kontext bei jeder Abfrage erneut gesendet und neu in Rechnung gestellt wird, verdoppelt eine Verdoppelung ungefähr Ihre Eingabekosten im großen Maßstab. Versuchen Sie, die Anzahl oder Größe der abgerufenen Passagen zu reduzieren, und beobachten Sie, wie sich die monatliche Zahl verändert – oft können Sie den Kontext erheblich reduzieren, ohne dabei an Qualität einzubüßen. Weil Ausgabe Der Preis pro Token ist in der Regel höher, aber die Anzahl ist weitaus geringer. Die Kontrolle ausführlicher Antworten hilft weniger als die Kontrolle des Kontexts. Verwenden Sie den Rechner, um den Punkt zu finden, an dem der Abruf groß genug ist, um eine gute Antwort zu geben, aber nicht so groß, dass die Kosten schneller steigen als der Wert, den jede Abfrage liefert.
Häufig gestellte Fragen
Was kostet ein RAG-Chatbot pro Anfrage?
Bei jeder RAG-Abfrage werden Kosten für die Einbettung der Frage, eine Vektordatenbanksuche und den LLM-Aufruf verursacht, der die abgerufenen Blöcke als Kontext einschließt. Die LLM-Eingabe (Ihr abgerufener Kontext kann Tausende von Token umfassen) dominiert normalerweise; Einbettungen und die Vektorabfrage kosten Cent oder weniger.
Wie reduziere ich die RAG-Kosten?
Rufen Sie weniger und kleinere Blöcke ab, speichern Sie die Systemeingabeaufforderung zwischen, verwenden Sie ein günstigeres Modell für Routineantworten und speichern Sie Einbettungen für wiederholte Abfragen zwischen. Die abgerufene Kontextgröße ist der größte Kostenhebel.