セッション量
セッションあたりのトークンコスト
ツール呼び出し (例: Web 検索)
規模別のコスト
実行時間コストは、モデルの実行量に関係なく、実時間のセッションの長さに応じて変化します。トークンのコストは、実際に読み書きされる量に応じて変化します。どちらもセッション数に比例して増加しますが、遅いエージェントはセッションごとに不釣り合いに長いランタイムを支払います。
| セッション/月 | ランタイム | トークン | ツール | 合計 |
|---|
セッション時間ごとの請求が別項目である理由
ホスト型エージェント プラットフォームでは、標準モデルのトークン レートに加えて、ランタイム環境自体 (サンドボックス、ブラウザ コンテキスト、またはエージェントが内部で実行される実行コンテナ) に対して請求することが増えています。 2026 年の代表的な料金は、アクティブ ランタイム時間あたり約 0.08 ドルです。これはトークンの価格設定に代わるものではなく、追加的なものです。長いエージェント セッションでは、環境がプロビジョニングされている実時間と、その環境が稼働している間に基盤となるモデルが読み書きするすべてのトークンの両方に対して料金が発生します。同じタスクを実行する 2 人のエージェントが、一方のエージェントが 90 秒で終了し、もう一方のエージェントが 8 分かかった場合、たとえトークン数がほぼ同じであっても、請求額が大きく異なる可能性があります。これは、遅いエージェントのほうが請求対象のランタイムを長く占有するためです。
これはまさに、この計算ツールと、純粋なステップごとまたはトークンごとのエージェント コスト ツールとの間のギャップです。モデルが呼び出すこれらの価格には、作業完了ではなくセッション時間に応じてスケールするディメンションが追加されます。これは、遅いツール呼び出しを待機したり、ページを参照したり、長いツール使用ループを実行したりするエージェントにとって最も重要です。アクティブなセッション内でモデルがアイドル状態に費やす時間は、待機中に消費されるトークンがほとんどない場合でも、セッション時間の請求を消費します。
両方に加えて、従量制ツールの使用量が重なります。2026 年の組み込み Web 検索ツールの一般的な料金は、検索 1,000 件あたり約 10 ドルです。エージェントが自由に検索すると、ランタイムとトークン請求の両方に関係なく、有意義なツール コストが蓄積されます。 2026 年のエージェントの合計コストは、実行時間、トークン、ツール呼び出しの 3 つのメーターを積み上げたものになります。これらのいずれかを「原価」として扱うと、実際の請求額が過小評価されます。実行時課金のない純粋なステップ/トークンごとのビューについては、 AIエージェントのコスト計算ツール または エージェント ループの予算計算ツール P99 の暴走コスト計画に。