Die Komprimierung liest den gesamten Kontext als Eingabe
Verdichtungsaufwand
Verdichtungen
Gemeinkosten
Gesamtlaufkosten

Wo sich Verdichtung auszahlt – den Abzug betätigen

Wenn Sie zu früh verdichten, lösen Sie viele Ereignisse aus. kompakt zu spät (oder nie) und jeder Schritt liest einen riesigen Kontext neu. Die Spalte „Gesamtkosten“ weist in der Regel ein Minimum in der Mitte auf.

Kompakt beiVerdichtungenOverheadGesamtlaufkosten

Für die Haushaltsführung hat niemand ein Budget

An autonomous agent has no long-term memory of its own run, so it keeps the whole working context in the prompt: the system instructions, the tool definitions, every tool result it has seen and every step it has taken. Dieser Kontext wächst monoton, und lange bevor er das Modellfenster überläuft, muss der Agent dies tun kompakt – Übergeben Sie den gesamten Kontext an das Modell, erhalten Sie eine komprimierte Zusammenfassung zurück und fahren Sie mit der Zusammenfassung fort. Die Komprimierung hält einen mehrstündigen Agenten am Leben, sie ist jedoch nicht kostenlos: Das Zusammenfassen eines 150.000-Token-Kontexts stellt 150.000 Eingabe-Tokens für dieses eine Ereignis in Rechnung, und ein Lauf, der drei- oder viermal komprimiert, kann allein dafür ein Fünftel bis ein Drittel seiner gesamten Token ausgeben. Es handelt sich um Kosten, die niemals im Preis pro Anruf und auch nie in einer naiven Schätzung auftauchen, und das ist genau der Grund, warum die Rechnungen der Makler höher ausfallen als auf der Rückseite des Umschlags angegeben. Die Möglichkeit, dies zu steuern, besteht darin, den Zeitpunkt der Komprimierung und die Größe des Zurücksetzens anzupassen und das erneute Lesen mit einem Rabatt durch Caching oder einen günstigeren Summierer in Rechnung zu stellen. Passen Sie die Multiturn-Seite an Kostenrechner für Multi-Turn-Gespräche, die ganze Schleife auf der Agentenschleifen-Budgetrechner, und der Caching-Gewinn auf dem Rechner für schnelle Caching-Einsparungen.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Agent-Loop-BudgetrechnerKosten für Multi-Runden-GesprächeKosten für den AI-Agent-SchrittKontextfensterkostenSofortige Caching-Einsparungen