—pro Anfrage
—einmalige Indizierung
—größte monatliche Kosten
Günstigstes Antwortmodell für diesen RAG
Gleicher Abruf und gleicher Traffic, jedes Modell nach monatlichen Kosten sortiert.
| Modell | Kosten/Monat | Pro Anfrage |
|---|
⚠️ Editierbare Schätzung anhand von Referenzpreisen (Juli 2026). Die Kosten für Vector DB variieren stark je nach Anbieter und Plan – legen Sie Ihren eigenen fest. Auch die tatsächlichen Rechnungen ändern sich mit der Häufigkeit von Reranking, Caching, Metadatenfilterung und Neuindizierung. ·
Veralteten Preis melden →
Wohin das RAG-Geld tatsächlich fließt
Die Leute gehen davon aus, dass Einbettungen der teure Teil von RAG sind. Sie sind normalerweise die günstigsten. Das Einbetten von 10.000 Kurzdokumenten kostet oft ein paar Cent und wird einmalig bezahlt. Die tatsächlichen, wiederkehrenden Kosten sind die LLM bei jeder Anfrage – und insbesondere die abgerufenen Kontext Du fütterst es. Ziehen Sie 5 Blöcke mit je 400 Token und Sie haben jeder einzelnen Frage 2.000 Eingabe-Token hinzugefügt, bevor der Benutzer überhaupt mit der Eingabe fertig ist. Multiplizieren Sie es mit Ihrem Abfragevolumen und das ist Ihre Rechnung. Das ist reine Vektor-RAG – wenn Sie stattdessen einen Wissensgraphen erstellen, fallen für den Indexierungsdurchgang selbst eigene LLM-Vorabkosten an, die separat auf der Website berechnet werden GraphRAG-Indizierungskostenrechner.
Die großen Hebel in der Reihenfolge: abrufen weniger/kleinere Stücke (Top-K und Chunk-Größe), verwenden Sie a günstigeres Antwortmodell für Routineanfragen und maximale Antwortlänge. Durch das erneute Einbetten nur geänderter Dokumente (nicht des gesamten Korpus) wird verhindert, dass die einmaligen Kosten erneut anfallen. Den Rest der App erstellen? Preis für einen Support-Bot mit dem Chatbot-Kostenrechner, eine ganze Funktion mit dem Kostenschätzer für KI-Apps, oder das vollständige Backend mit dem API-Stack-Kostenrechner. Nur die Speicherschicht dimensionieren? Siehe die Kostenrechner für Vektordatenbanken für Pinecone vs. Qdrant vs. pgvector.
BinanceTwilioGoogle GeminiCoinGeckoKI und LLMsKosten für KI-Suche/Antwortmaschine
So funktioniert dieser Rechner
Der RAG-Kostenrechner schätzt die monatlichen Kosten für den Betrieb einer Pipeline zur Erzeugung erweiterter Abrufe durch die Kombination von drei separaten Rechnungen. Zunächst wird a berechnet einmalige Einbettungskosten basierend auf der Anzahl Ihrer Dokumente, den durchschnittlichen Token pro Dokument und der Blockgröße, berechnet nach dem ausgewählten Einbettungsmodell. Zweitens berücksichtigt es die Vektordatenbank, die diese Chunk-Einbettungen speichert. Als drittes, und normalerweise größtes, berechnet es die wiederkehrenden Werte LLM-Kosten pro Abfrage: Ihr monatliches Abfragevolumen multipliziert mit den Eingabe-Tokens der abgerufenen Blöcke (top-k) plus der generierten Antwortlänge, berechnet nach dem gewählten Antwortmodell. Das Abfragevolumen, Top-K und das Antwortmodell sind die Haupttreiber.
Beobachten Sie die Top-K-Abrufeinstellung eng. Jeder abgerufene Block wird zur Eingabeaufforderung jeder Abfrage hinzugefügt, sodass eine Erhöhung der Top-K- oder Blockgröße die Anzahl der Eingabetokens direkt erhöht jeder Abfrage für den ganzen Monat. Das Abrufen von mehr Kontext kann die Antwortqualität verbessern, die Kosten steigen jedoch linear mit den Abfragen. Ein praktischer Tipp: Rufen Sie weniger, engere Blöcke ab und reservieren Sie ein größeres, teureres Antwortmodell nur dann, wenn die Genauigkeit dies rechtfertigt. Für die Einbettung fallen feste Vorabkosten an, während die LLM-Rechnung pro Abfrage mit der Nutzung zusammenhängt. Optimieren Sie daher zuerst den Abfragepfad.
Häufig gestellte Fragen
Wie hoch sind die Kosten für ein RAG-System?
Drei Teile. Einmalig: Einbetten aller Ihrer Dokumente in Vektoren. Monatlich fortlaufend: die Vektordatenbank, die diese Vektoren speichert und durchsucht, zuzüglich der LLM-Kosten pro Abfrage – einschließlich der abgerufenen Teile, die Sie als Kontext in die Eingabeaufforderung einfügen. Bei den meisten RAG-Apps dominieren die LLM-Kosten pro Abfrage, da der abgerufene Kontext weitaus größer sein kann als die eigentliche Frage des Benutzers.
Warum ist der abgerufene Kontext der größte RAG-Kostenfaktor?
Jede Abfrage sendet die abgerufenen Top-k-Chunks als Eingabetoken an das Modell. Rufen Sie 5 Blöcke mit 400 Token ab und Sie zahlen für 2.000 Eingabe-Token pro Abfrage, bevor der Benutzer viel gesagt hat. Das Abrufen von weniger oder kleineren Blöcken oder die Verwendung eines günstigeren Modells senkt die Kosten weitaus mehr als der Wechsel von Einbettungsmodellen.