Die Falle mit Agenten: Eine Aufgabe, die wie eine Frage aussieht, besteht in Wirklichkeit aus 5–20 LLM-Anrufen. Ein Chatbot antwortet einmal. Ein Agent argumentiert, ruft Tools auf und liest seinen eigenen wachsenden Kontext bei jedem Schritt erneut – sodass dasselbe Modell, das einen Bruchteil eines Cents pro Chat-Nachricht kostet, das Zehn- bis Fünfzigfache der Kosten pro Agentenaufgabe kosten kann. Dieser Rechner multipliziert es richtig.

pro Monat
pro Aufgabe
pro Jahr
LLM-Anrufe/Monat

Günstigste Modelle für diesen Agenten

Gleicher Arbeitsaufwand, jedes Modell nach monatlichen Kosten sortiert.

ModellKosten/MonatPro Aufgabe
⚠️ Schätzung anhand von Referenzpreisen (Juli 2026) und Listenpreisen. Die tatsächlichen Agentenkosten hängen stark davon ab, wie viel Kontext Sie bei jedem Schritt erneut senden – Agenten, die den gesamten Verlauf erneut einspeisen, erhöhen die Eingabetokens in jeder Schleife. Geben Sie Ihre tatsächliche Tokenanzahl pro Schritt ein, um den nächstgelegenen Wert zu erhalten. · Veralteten Preis melden →

Wie sich die Maklerkosten tatsächlich summieren

Die Formel lautet Aufgaben × Schritte × (Input-Tokens × Input-Preis + Output-Tokens × Output-Preis). Der Multiplikator, den die Leute vergessen, ist Schritte: Ein Forschungsagent könnte 12 Schleifen benötigen, ein Codierungsagent 20+. Und da die meisten Agenten die gesammelten Gespräche bei jedem Schritt erneut senden, Die Eingabemarken pro Schritt steigen mit fortschreitender Aufgabe — Die oben eingegebene Zahl ist der Durchschnitt über die gesamte Schleife. Aus diesem Grund ist die Ausgabe pro Schritt (ein kurzer Gedanke oder ein Tool-Aufruf) normalerweise gering Der Input dominiert die Agentenrechnung – und warum schnelles Caching und Kontexttrimmen hier wichtiger sind als anderswo.

Wie man es schneidet

Vier Hebel, in der Reihenfolge ihrer Wirkung: (1) Modellrouting — ein kleines Modell für Routineschritte und ein Grenzmodell nur für die schwierigen Schritte verwenden; (2) Stufenkappe — außer Kontrolle geratene Schleifen stoppen; (3) Kontexttrimmen – Senden Sie nicht bei jedem Schritt den gesamten Verlauf erneut. (4) Sofortiges Caching für die statische Systemeingabeaufforderung und Tooldefinitionen. Siehe die Prompt-Caching-Anleitung und die Rechner für Caching-Einsparungen. Einen Chatbot statt eines Agenten bauen? Benutzen Sie die Chatbot-Kostenrechner. Ganze App? Der Kostenschätzer für KI-Apps. Führen Sie mehr als einen Agenten für die gleiche Aufgabe aus – Fan-Out-, Debatten-, Supervisor- oder Schwarmmuster? Dieser Rechner berechnet die Preise für einen einzelnen Makler. Benutze die Rechner für Schwarmkosten von KI-Agenten um den Multiplikator zu sehen, den diese Orchestrierungsmuster zusätzlich hinzufügen.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Kostenrechner für die LLM-EvaluierungKostenrechner für die Erzeugung synthetischer DatenAI-Seat-Lizenz vs. API-KostenrechnerZeit- und Kostenrechner für die StapelverarbeitungKI-Kosten-pro-Benutzer-Rechner