Modell & Aufgabenprofil
Screenshot-Aufbewahrung – der größte Kostenhebel
Gleiche Aufgabe, gleiche Schritte – nur wie viele vorherige Screenshots im Kontext bleiben, ändert sich. Alte Screenshots von veralteten Bildschirmzuständen verbessern selten die nächste Aktion, werden aber immer als neue Eingabetokens dargestellt.
| Strategie | Geben Sie Token / Aufgabe ein | Kosten / Aufgabe | Monatlich | vs. Alles behalten |
|---|
In der Screenshot-Schleife gehen die Budgets für die Browser-Automatisierung verloren
Ein Computer-Use-Agent liest das DOM nicht, sondern schaut auf den Bildschirm. Jeder Schritt jeder Aufgabe ist ein vollständiger Rundlauf: Machen Sie einen Screenshot, senden Sie ihn als Vision-Eingabetoken an das Modell, erhalten Sie eine Klick-, Tipp- oder Scroll-Aktion zurück, führen Sie sie aus und machen Sie den nächsten Screenshot. Mit etwa 1.000–1.600 Token pro Screenshot (abhängig von der Auflösung) und 10–30 Schritten für eine Routineaufgabe stellt die visuelle Eingabe allein alles andere in der Anfrage in den Schatten. Die tatsächliche Textausgabe des Modells – eine Koordinate und eine kurze Begründung – ist im Vergleich trivial klein. Diese Umkehrung überrascht Teams: Bei Chat-Workloads sind Ausgabetokens der teure Teil; Bei der Computernutzung beträgt der Aufwand in der Regel 80–95 % der Rechnung.
Die Kontextakkumulation ist der Multiplikator an der Spitze. Wenn der Agent jeden vorherigen Screenshot in der Konversation behält, sendet Schritt 15 vierzehn veraltete Screenshots plus den aktuellen erneut und die Gesamtzahl der Screenshot-Tokens wächst quadratisch mit der Aufgabenlänge – eine 15-Schritte-Aufgabe mit 1.200 Tokens pro Screenshot verbrennt etwa 144.000 Screenshot-Tokens mit vollständigem Verlauf im Vergleich zu etwa 50.000, bei denen nur die letzten drei beibehalten werden. Diese einzelne Aufbewahrungseinstellung ändert die dominierende Kostenkomponente um fast das Dreifache, weshalb die Referenzimplementierung von Anthropic alte Screenshots standardmäßig kürzt. Die gleiche akkumulierende Kontextberechnung für Nur-Text-Agenten wird in unserem behandelt Schrittkostenrechner für KI-Agenten; Screenshots erhöhen den Einsatz einfach um eine Größenordnung.
Zwei praktische Hinweise. Erstens das Budget für Wiederholungsversuche: Computernutzende Agenten schlagen fehl und führen Aufgaben mit sinnvollen Raten erneut aus (Änderungen der Benutzeroberfläche, Zeitüberschreitungen, Fehlklicks), und ein Wiederholungsversuchszuschuss von 10–20 % gehört in jede ehrliche Schätzung. Zweitens ist die Auflösung ein echter Hebel: Durch das Herunterskalieren von Aufnahmen auf die effektive Auflösung des Modells vor dem Senden wird vermieden, dass für Pixel bezahlt werden muss, die das Modell ohnehin neu berechnet. Wenn Ihre Arbeitsbelastung eher kratz- als interaktionsförmig ist, vergleichen Sie sie mit einer herkömmlichen Web-Scraping-API: Wenn kein Klicken oder Tippen erforderlich ist, sind Screenshots eine teure Möglichkeit, eine Seite zu lesen.