圧縮が効果を発揮する場合 - トリガーをスイープする
圧縮が早すぎると、多くのイベントが発生します。コンパクトにするのが遅すぎる(またはまったくしない)と、各ステップで巨大なコンテキストが再読み込みされます。通常、合計コストの列には中央に最小値があります。
誰も予算を立てないハウスキーピング
An autonomous agent has no long-term memory of its own run, so it keeps the whole working context in the prompt: the system instructions, the tool definitions, every tool result it has seen and every step it has taken.そのコンテキストは単調に増加し、モデルのウィンドウからオーバーフローするずっと前に、エージェントは次のことを行う必要があります。 コンパクト — コンテキスト全体をモデルに渡し、圧縮された概要を取得して、その概要から続行します。圧縮は複数時間にわたるエージェントを存続させるものですが、無料ではありません。150,000 トークンのコンテキストを要約すると、その 1 つのイベントに対して 150,000 の入力トークンが請求され、圧縮を 3 回または 4 回実行すると、これだけで合計トークンの 5 分の 1 から 3 分の 1 が費やされる可能性があります。これは、通話ごとの価格には決して現れず、トークンの単純な見積もりにも決して現れないコストです。まさにこれが、エージェントの請求額が封筒の裏の計算よりも高額になる理由です。これを制御する方法は、いつ圧縮するか、どのくらいのサイズにリセットするかを調整し、キャッシュまたはより安価なサマライザーを使用して再読み取りを割引料金で請求することです。マルチターン側のサイズを調整します。 マルチターン会話コスト計算ツールのループ全体 エージェント ループの予算計算ツール、そしてキャッシングの勝利 プロンプトキャッシュ節約計算ツール.
エージェント ループの予算計算ツールマルチターン会話コストAI エージェントのステップ コストコンテキストウィンドウのコスト即時キャッシュによる節約
よくある質問
コンテキスト圧縮とは何ですか?なぜ費用がかかるのですか?
長時間実行されるエージェントは、モデルのコンテキスト ウィンドウに近づくまでコンテキスト (ツールの結果、メッセージ、推論) を蓄積します。継続するために圧縮します。現在のコンテキスト全体をモデルにフィードし、圧縮された概要を要求し、完全な履歴ではなくその概要から続行します。問題は、要約とはすべてを再読み込みすることを意味するため、各圧縮イベントでは入力トークンとしてコンテキスト全体と要約用の小さな出力が請求されることです。 150,000 トークンのコンテキストを 1 回圧縮する場合、150,000 個の入力トークンと同じコストがかかり、複数回圧縮する長いエージェントは、このハウスキーピングだけで総トークンの 5 分の 1 から 3 分の 1 を費やす可能性があります。
エージェントは何回圧縮しますか?
それは、コンテキストがどれだけ速く成長するか、およびトリガーがどこに配置されるかによって異なります。各ステップでツール出力の数千トークンが追加され、エージェントがたとえば 140,000 トークンに達したときに圧縮され、その後 25,000 トークンの概要にリセットされる場合、エージェントはそのギャップを再び上るたびにほぼ圧縮されます。ステップごとに 8,000 トークンを追加し、140k で圧縮する実行では、約 15 ステップごとに圧縮が開始されます。この計算ツールは、実行を段階的にシミュレートし、圧縮をカウントし、生産コストを圧縮オーバーヘッドから分離して、分割を確認できるようにします。
圧縮のオーバーヘッドを減らすにはどうすればよいですか?
3本のレバーで動かします。後で圧縮する (トリガーを高くする) と、圧縮の回数は少なく、より大きくなりますが、毎ターン再読み込みするコンテキストが大きくなるため、生産的なステップがより高価になります。常に高いほど良いというわけではなく、真のスイート スポットが存在します。より小さなサマリーにリセットすると、圧縮間の滑走路がさらに多く購入されます。また、要約自体をより安価なモデルにルーティングするか、プロンプト キャッシュを使用して再読み取りプレフィックスが割引料金で請求されるようにすることで、イベントごとのコストが直接削減されます。このページの表はトリガーのしきい値をスイープしているので、総コストがどのように変化するかを確認できます。また、まったく圧縮しないことも示されています。これは、コンテキストが際限なく増大し、すべてのステップでその代償が支払われるため、通常は最悪のオプションです。
圧縮は、より大きなコンテキスト ウィンドウを使用するよりもコストがかかりますか?
圧縮に代わる方法では、すべてのステップで完全な履歴が保持され、何もトリミングされない場合、入力コストは実行長の 2 乗に応じて増加するため、多くの場合そのとおりです。圧縮によって成長が抑制されます。各要約の後、ステップごとのコンテキストが元に戻るため、生産コストは二次関数ではなくほぼ直線のままになります。圧縮イベントごとに一時金を支払いますが、ますます大きくなるトランスクリプトを何千回も再読する必要はありません。非常に短い実行の場合、オーバーヘッドは価値がありません。自律エージェントを長期間使用すると、通常は何倍もの費用が発生しますが、この計算ツールを使用すると、自分の数値を確認できます。