Ein Agent antwortet nicht in einem einzigen Anruf – es läuft in einer Schleife ab: Nachdenken, ein Tool aufrufen, das Ergebnis lesen, noch einmal nachdenken. Bei jeder Schleife handelt es sich um eine kostenpflichtige Anfrage, sodass sich die Kosten mit der Anzahl der Schritte multiplizieren. Geben Sie Ihren Verbrauch ein, um die tatsächliche Monatsrechnung und das günstigste Modell für den Auftrag anzuzeigen.
Die Falle mit Agenten: Eine Aufgabe, die wie eine Frage aussieht, besteht in Wirklichkeit aus 5–20 LLM-Anrufen. Ein Chatbot antwortet einmal. Ein Agent argumentiert, ruft Tools auf und liest seinen eigenen wachsenden Kontext bei jedem Schritt erneut – sodass dasselbe Modell, das einen Bruchteil eines Cents pro Chat-Nachricht kostet, das Zehn- bis Fünfzigfache der Kosten pro Agentenaufgabe kosten kann. Dieser Rechner multipliziert es richtig.
—
pro Monat
—pro Aufgabe
—pro Jahr
—LLM-Anrufe/Monat
Günstigste Modelle für diesen Agenten
Gleicher Arbeitsaufwand, jedes Modell nach monatlichen Kosten sortiert.
Modell
Kosten/Monat
Pro Aufgabe
⚠️ Schätzung anhand von Referenzpreisen (Juli 2026) und Listenpreisen. Die tatsächlichen Agentenkosten hängen stark davon ab, wie viel Kontext Sie bei jedem Schritt erneut senden – Agenten, die den gesamten Verlauf erneut einspeisen, erhöhen die Eingabetokens in jeder Schleife. Geben Sie Ihre tatsächliche Tokenanzahl pro Schritt ein, um den nächstgelegenen Wert zu erhalten. · Veralteten Preis melden →
Wie sich die Maklerkosten tatsächlich summieren
Die Formel lautet Aufgaben × Schritte × (Input-Tokens × Input-Preis + Output-Tokens × Output-Preis). Der Multiplikator, den die Leute vergessen, ist Schritte: Ein Forschungsagent könnte 12 Schleifen benötigen, ein Codierungsagent 20+. Und da die meisten Agenten die gesammelten Gespräche bei jedem Schritt erneut senden, Die Eingabemarken pro Schritt steigen mit fortschreitender Aufgabe — Die oben eingegebene Zahl ist der Durchschnitt über die gesamte Schleife. Aus diesem Grund ist die Ausgabe pro Schritt (ein kurzer Gedanke oder ein Tool-Aufruf) normalerweise gering Der Input dominiert die Agentenrechnung – und warum schnelles Caching und Kontexttrimmen hier wichtiger sind als anderswo.
Wie man es schneidet
Vier Hebel, in der Reihenfolge ihrer Wirkung: (1) Modellrouting — ein kleines Modell für Routineschritte und ein Grenzmodell nur für die schwierigen Schritte verwenden; (2) Stufenkappe — außer Kontrolle geratene Schleifen stoppen; (3) Kontexttrimmen – Senden Sie nicht bei jedem Schritt den gesamten Verlauf erneut. (4) Sofortiges Caching für die statische Systemeingabeaufforderung und Tooldefinitionen. Siehe die Prompt-Caching-Anleitung und die Rechner für Caching-Einsparungen. Einen Chatbot statt eines Agenten bauen? Benutzen Sie die Chatbot-Kostenrechner. Ganze App? Der Kostenschätzer für KI-Apps. Führen Sie mehr als einen Agenten für die gleiche Aufgabe aus – Fan-Out-, Debatten-, Supervisor- oder Schwarmmuster? Dieser Rechner berechnet die Preise für einen einzelnen Makler. Benutze die Rechner für Schwarmkosten von KI-Agenten um den Multiplikator zu sehen, den diese Orchestrierungsmuster zusätzlich hinzufügen.
Der Kostenrechner für KI-Agenten schätzt die monatlichen LLM-Ausgaben für den Betrieb eines KI-Agenten. Weil ein Agent jede Aufgabe durch mehrere erledigt LLM-Schritte – Argumentationsrunden plus Werkzeugaufrufe – die Kosten einer Aufgabe sind die Token-Kosten pro Schritt multipliziert mit jedem Schritt und dann noch einmal multipliziert mit Ihrem monatlichen Aufgabenvolumen. Die Haupttreiber sind Sie Aufgaben pro Monat, die Anzahl der LLM-Schritte pro Aufgabe, Die durchschnittliche Eingabe- und Ausgabe-Tokens pro Schritt, Die Modell Sie wählen (wodurch der Preis pro Token festgelegt wird) und beliebig Optimierung wie Caching oder günstigere Modelle. Kleine Zahlen pro Schritt summieren sich schnell über Schritte und Aufgaben hinweg.
Der wichtigste Kompromiss, den es zu beobachten gilt, ist Schrittzahl versus Modellqualität. Ein günstigeres Modell erfordert möglicherweise mehr Argumentationsschritte oder Wiederholungsversuche, um eine Aufgabe abzuschließen. Daher bedeutet ein niedrigerer Preis pro Token nicht immer eine niedrigere Gesamtsumme. Schätzen Sie die Kosten für die gesamte Aufgabe, nicht für einen einzelnen Anruf, und stellen Sie sicher, dass die von Ihnen eingegebenen Token-Zählungen echte Eingabeaufforderungen widerspiegeln – lange Systemanweisungen und Werkzeugausgaben werden bei jedem Schritt als Eingabe gezählt.
Häufig gestellte Fragen
Warum kostet ein KI-Agent mehr als ein einzelner Chatbot-Anruf?
Ein Agent löst eine Aufgabe über viele LLM-Anrufe hinweg – er begründet, ruft ein Tool auf, liest das Ergebnis, begründet erneut und wiederholt den Vorgang. Bei jedem Schritt handelt es sich um eine vollständig abgerechnete Anfrage, und der laufende Kontext wächst normalerweise mit jedem Schritt, sodass eine einzelne Aufgabe das 5- bis 20-fache einer einmaligen Chatbot-Antwort kosten kann.
Wie reduziere ich die Kosten für KI-Agenten?
Verwenden Sie ein günstigeres Modell für Routineschritte und reservieren Sie ein Grenzmodell für schwierige Schritte, begrenzen Sie die Anzahl der Schritte pro Aufgabe, kürzen Sie den Kontext, den Sie für jeden Schritt erneut senden, und aktivieren Sie die Zwischenspeicherung von Eingabeaufforderungen für die statischen Systemeingabeaufforderungen und Tooldefinitionen, die bei jedem Aufruf wiederholt werden.