セッション量
セッションあたりのトークンコスト
ツール呼び出し (例: Web 検索)
規模別のコスト
実行時間コストは、モデルの実行量に関係なく、実時間のセッションの長さに応じて変化します。トークンのコストは、実際に読み書きされる量に応じて変化します。どちらもセッション数に比例して増加しますが、遅いエージェントはセッションごとに不釣り合いに長いランタイムを支払います。
セッション時間ごとの請求が別項目である理由
ホスト型エージェント プラットフォームでは、標準モデルのトークン レートに加えて、ランタイム環境自体 (サンドボックス、ブラウザ コンテキスト、またはエージェントが内部で実行される実行コンテナ) に対して請求することが増えています。 2026 年の代表的な料金は、アクティブ ランタイム時間あたり約 0.08 ドルです。これはトークンの価格設定に代わるものではなく、追加的なものです。長いエージェント セッションでは、環境がプロビジョニングされている実時間と、その環境が稼働している間に基盤となるモデルが読み書きするすべてのトークンの両方に対して料金が発生します。同じタスクを実行する 2 人のエージェントが、一方のエージェントが 90 秒で終了し、もう一方のエージェントが 8 分かかった場合、たとえトークン数がほぼ同じであっても、請求額が大きく異なる可能性があります。これは、遅いエージェントのほうが請求対象のランタイムを長く占有するためです。
これはまさに、この計算ツールと、純粋なステップごとまたはトークンごとのエージェント コスト ツールとの間のギャップです。モデルが呼び出すこれらの価格には、作業完了ではなくセッション時間に応じてスケールするディメンションが追加されます。これは、遅いツール呼び出しを待機したり、ページを参照したり、長いツール使用ループを実行したりするエージェントにとって最も重要です。アクティブなセッション内でモデルがアイドル状態に費やす時間は、待機中に消費されるトークンがほとんどない場合でも、セッション時間の請求を消費します。
両方に加えて、従量制ツールの使用量が重なります。2026 年の組み込み Web 検索ツールの一般的な料金は、検索 1,000 件あたり約 10 ドルです。エージェントが自由に検索すると、ランタイムとトークン請求の両方に関係なく、有意義なツール コストが蓄積されます。 2026 年のエージェントの合計コストは、実行時間、トークン、ツール呼び出しの 3 つのメーターを積み上げたものになります。これらのいずれかを「原価」として扱うと、実際の請求額が過小評価されます。実行時課金のない純粋なステップ/トークンごとのビューについては、 AIエージェントのコスト計算ツール または エージェント ループの予算計算ツール P99 の暴走コスト計画に。
AI エージェントのコスト計算ツールエージェント ループの予算AI エージェントのステップ コストパソコン利用エージェント費用Web検索ツールのコスト
この計算機の仕組み
の 管理対象エージェントのセッションコスト計算ツール トークンの支出だけでなく、ホスト型エージェントの実行にかかる実際の毎月のコストを見積もります。これは、次の 3 つの請求次元を組み合わせたものです。 セッション時間料金 アクティブな実行時間時間ごとに課金されます (たとえば、0.08 ドル)、標準 入力および出力トークン レート 価格は 100 万トークンごと、および検索 工具代。 1 日あたりのセッション、平均セッション期間、1 か月あたりのアクティブ日数、セッションあたりの入力トークンと出力トークン、2 つのトークン価格、およびセッションあたりの検索を入力します。計算機はこれらを乗算して、どのように計算されるかを確認します。 実行時間、トークン量、およびツール呼び出しがそれぞれ合計に寄与します。
注意すべき重要なトレードオフは次のとおりです。 セッション期間。ランタイムは時間単位で課金されるため、モデルが生成されているかどうかに関係なく実時間に対して料金が発生するため、ステップ間でアイドル状態にあるエージェントの存続期間が長い場合、トークンが示すよりもコストが高くなる可能性があります。セッション時間料金が合計の大部分を占める場合は、セッションを短縮したり、すぐに終了したり、作業をバッチ処理したりすることで、トークンをトリミングするよりも節約できることがよくあります。トークン料金が大半を占める場合は、代わりに次の点に焦点を当てます。 出力長さ そして検索頻度。入力を調整して、実際に請求書を制御しているドライバーを見つけます。
よくある質問
AI エージェントのセッション時間課金とは何ですか?
一部のマネージド/ホスト型エージェント ランタイムでは、エージェントが実行するモデル呼び出しのトークン コストとは別に、アクティブなランタイム環境自体 (エージェントが動作するサンドボックス、ブラウザー、または実行コンテキスト) に対して時間単位の料金を請求するようになりました。 2026 年の代表的な料金は、アクティブなランタイムのセッション時間あたり約 0.08 ドルです。これは、標準の入力/出力トークンの価格設定に追加されるものであり、それに代わるものではありません。長時間実行されるエージェント セッションでは、その環境が存続する実時間と、その時間内にモデルが読み書きするすべてのトークンの両方に対して支払いが行われます。
これは、ステップごとまたはトークンごとのエージェント コスト計算ツールとどのように異なりますか?
ステップベースおよびトークンベースのエージェント計算ツールは、モデル呼び出しの価格、つまりターン数、ターンあたりの入力/出力トークンの数を決定します。この計算ツールは、それらが見逃している次元、つまりランタイム環境自体の時間当たりの料金を追加します。これは、その時間中にモデルが実際に実行した量ではなく、実時間のセッション期間に応じて増減します。タスクを完了するのに 20 分かかる遅いエージェントは、そのウィンドウ内でほとんどモデル呼び出しを行わなかったとしても、20 分間のセッション時間の請求額を支払います。同じタスクを 2 分で完了する高速エージェントは、トークン数に関係なく、実行時間コストがはるかに低くなります。どちらの寸法も重要であり、このツールはそれらを一緒にモデル化します。
管理対象エージェントは通常、他にどのような使用ごとのコストを追加しますか?
実行時間とトークンのコストを超えて、ホスト型エージェント プラットフォームは通常、個々のツール呼び出しを個別に測定します。組み込み Web 検索ツールの一般的な 2026 年の料金は、検索 1,000 件あたり約 10 ドルです。エージェントのタスクに他の従量制ツールの参照、検索、または呼び出しが含まれる場合、クラウドの料金がコンピューティング、ストレージ、下りを個別の項目として積み上げるのと同じ方法で、それらの通話ごとのコストがランタイムとトークンのコストの上に積み重なります。