monatliche Kosten
Kosten / Anfrage
Kostenanteil der Such-API
Kostenanteil der LLM-Synthese

Statische RAG-äquivalente Kosten im Vergleich zu den tatsächlichen Kosten der Antwortmaschine

Gleiche LLM-Ein- und -Ausgaben, abzüglich der API-Gebühr für die Live-Websuche – das ist, was genau dieselbe Abfrage kosten würde wie ein vorindiziertes statisches RAG-System ohne Live-Suche. Die Lücke ist die Prämie für die Live-Suche.

KostenbasisKosten/AnfrageMonatliche Kosten
Statisches RAG-Äquivalent (nur LLM-Synthese, keine Live-Suchgebühr)
Tatsächliche Antwort-Engine-Kosten (LLM-Synthese + Live-Such-API)

Kosten nach abgerufenen Snippets (Top-K)

Alles andere wird bei den oben genannten Werten gehalten und berücksichtigt, wie viele Suchergebnisse pro Abfrage in den LLM-Kontext eingefügt werden. Mehr Snippets können fundiertere Antworten bedeuten, aber jedes zusätzliche Snippet bedeutet zusätzliche Eingabe-Tokens, die für jede einzelne Abfrage in Rechnung gestellt werden.

Snippets (Top-K)Eingabetoken/AbfrageKosten/AnfrageMonatliche Kosten

Wie dies mit anderen Tools verbunden ist

Diese Seite kostet a Live-Such-Antwortmaschine – eine Pipeline im Perplexity / You.com / Bing Copilot-Stil, bei der jede Abfrage auf eine Websuch-API eines Drittanbieters trifft, bevor das LLM die Frage jemals sieht. Das ist eine andere Architektur als ein System, das auf einem Korpus basiert, den Sie bereits besitzen: Wenn es sich bei Ihrem Abrufschritt um eine Vektorsuche anhand von Dokumenten handelt, die Sie selbst indiziert haben, ohne Live-Such-API-Gebühr für jede Abfrage, berechnen Sie den Preis entsprechend RAG-Kostenrechner stattdessen, oder die RAG Chatbot-Kostenrechner für eine Konversationsschnittstelle mit Geschichte auf demselben statischen Korpus. Wenn Sie speziell eine Knowledge-Graph-Architektur anstelle des einfachen Vektorabrufs in Betracht ziehen, ist dies der Fall GraphRAG-Indizierungskostenrechner Preise für den einmaligen Extraktionsdurchlauf, der es erstellt. Und da jede Abfrage hier den vollen Eingabe-Token-Preis für die gleiche Systemeingabeaufforderung und Overhead-Tokens bei Wiederholung zahlt, prüfen Sie, ob durch Eingabeaufforderungs-Caching diese wiederkehrenden Kosten gesenkt werden können Rechner für sofortige Caching-Einsparungen.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS