圧縮はコンテキスト全体を入力として読み取ります
圧縮のオーバーヘッド
圧縮
諸経費
総ランニングコスト

圧縮が効果を発揮する場合 - トリガーをスイープする

圧縮が早すぎると、多くのイベントが発生します。コンパクトにするのが遅すぎる(またはまったくしない)と、各ステップで巨大なコンテキストが再読み込みされます。通常、合計コストの列には中央に最小値があります。

コンパクトに圧縮オーバーヘッド総ランニングコスト

誰も予算を立てないハウスキーピング

An autonomous agent has no long-term memory of its own run, so it keeps the whole working context in the prompt: the system instructions, the tool definitions, every tool result it has seen and every step it has taken.そのコンテキストは単調に増加し、モデルのウィンドウからオーバーフローするずっと前に、エージェントは次のことを行う必要があります。 コンパクト — コンテキスト全体をモデルに渡し、圧縮された概要を取得して、その概要から続行します。圧縮は複数時間にわたるエージェントを存続させるものですが、無料ではありません。150,000 トークンのコンテキストを要約すると、その 1 つのイベントに対して 150,000 の入力トークンが請求され、圧縮を 3 回または 4 回実行すると、これだけで合計トークンの 5 分の 1 から 3 分の 1 が費やされる可能性があります。これは、通話ごとの価格には決して現れず、トークンの単純な見積もりにも決して現れないコストです。まさにこれが、エージェントの請求額が封筒の裏の計算よりも高額になる理由です。これを制御する方法は、いつ圧縮するか、どのくらいのサイズにリセットするかを調整し、キャッシュまたはより安価なサマライザーを使用して再読み取りを割引料金で請求することです。マルチターン側のサイズを調整します。 マルチターン会話コスト計算ツールのループ全体 エージェント ループの予算計算ツール、そしてキャッシングの勝利 プロンプトキャッシュ節約計算ツール.

プロジェクトをホストします。DigitalOcean — $200 無料 ↗ホスティンガー VPS
エージェント ループの予算計算ツールマルチターン会話コストAI エージェントのステップ コストコンテキストウィンドウのコスト即時キャッシュによる節約