モデルとタスクのプロファイル

入力トークン/タスク
請求書のスクリーンショットのシェア
コスト/タスク
月額費用

スクリーンショットの保持 - 最大のコストレバー

同じタスク、同じ手順 - コンテキストに残る以前のスクリーンショットの数だけが変わります。古い画面状態の古いスクリーンショットによって次のアクションが改善されることはほとんどありませんが、常に新しい入力トークンとして請求されます。

戦略タスク/タスクを入力コスト/タスク毎月vsキープオール

スクリーンショット ループはブラウザ自動化の予算がなくなる場所です

コンピュータを使用するエージェントは DOM を読み取らず、画面を参照します。すべてのタスクの各ステップは完全なラウンド トリップです。スクリーンショットをキャプチャし、それをビジョン入力トークンとしてモデルに送信し、クリック、入力、またはスクロール アクションを取得して実行し、次のスクリーンショットをキャプチャします。スクリーンショットごとに約 1,000 ~ 1,600 トークン (解像度に依存)、ルーチン タスクのステップが 10 ~ 30 ステップであるため、ビジョン入力だけでもリクエスト内の他のすべての内容に比べて小さく見えます。モデルの実際のテキスト出力 (座標と短い位置揃え) は、比較するとわずかに小さいです。この逆転によりチームは不意を突かれます。チャット ワークロードでは、出力トークンが高価な部分になります。コンピュータの使用では、入力は通常請求額の 80 ~ 95% を占めます。

コンテキストの累積が最上位の乗数です。エージェントが会話内の以前のすべてのスクリーンショットを保持している場合、ステップ 15 で 14 個の古いスクリーンショットと現在のスクリーンショットが再送信され、合計スクリーンショット トークンはタスクの長さに応じて二次関数的に増加します。スクリーンショットあたり 1,200 トークンの 15 ステップのタスクでは、完全な履歴を含む約 144K のスクリーンショット トークンが消費されますが、最後の 3 つだけを保持する場合は約 50K のスクリーンショット トークンが消費されます。この 1 つの保持設定により、主要なコスト コンポーネントが 3 倍近く変化します。これが、Anthropic のリファレンス実装がデフォルトで古いスクリーンショットをトリミングする理由です。テキストのみのエージェントに対する同様の蓄積コンテキスト計算については、 AI エージェントのステップ コスト計算ツール;スクリーンショットは賭け金を一桁上げるだけです。

実用的なメモが 2 つあります。まず、再試行の予算を立てます。コンピュータを使用するエージェントは、意味のある割合 (UI の変更、タイムアウト、クリックミス) で失敗してタスクを再実行します。正直に見積もっても 10 ~ 20% の再試行許容値が含まれます。第 2 に、解像度は実際の手段です。送信前にキャプチャをモデルの実効解像度にダウンスケーリングすることで、いずれにせよモデルがリサンプリングするピクセルに対する支払いを回避できます。ワークロードがインタラクション型ではなくスクレイピング型の場合は、従来のワークロードと比較してください。 ウェブスクレイピングAPI: クリックや入力が必要ない場合、スクリーンショットはページを読むためのコストのかかる方法です。

プロジェクトをホストします。DigitalOcean — $200 無料 ↗ホスティンガー VPS
AI エージェントのステップ コストエージェント ループ P99 予算ビジョン画像入力コストディープリサーチAPIのコスト