出力トークンが請求書となります。 生成では、トークンごとに完全な前方パスが実行されます。 prefill は、トークンごとのエネルギーの約 10 分の 1 でプロンプト全体を並列処理します。長いプロンプトと長い応答は、短いプロンプトと長いプロンプトよりもはるかにコストがかかります。また、推論モデルの隠されたトレースは出力としてカウントされます。
すべてのモデルクラスで同じワークロード
リクエストの量とトークンの形状が同じで、異なる層にルーティングされます。推論層への移行は増分的ではありません。これは、推論炭素予算において制御可能な単一の最大の要素です。
| モデルクラス | Wh / 1k出力tok | kWh/月 | kg CO2e/月 | 電力コスト/月 |
|---|
どの地域でも同じワークロード
同一のコンピューティング、同一のエネルギー - グリッドのみが変更されます。これは、地域を選択できるプロバイダーを利用している人が利用できる最も安価な排出量削減です。
| 地域 | g CO2e / kWh | kg CO2e/月 | t CO2e / 年 | あなたの地域との比較 |
|---|
トークンの合計よりも入出力の分割が重要な理由
AI のエネルギーを推定しようとするほぼすべての試みでは、トークンの合計にトークンごとの単一の数値が乗算されますが、これは重要な点で間違っています。 Transformer の推論には、コスト プロファイルがまったく異なる 2 つのフェーズがあります。 Prefill は 1 つの高度な並列パスでプロンプト全体を読み取るため、1,500 トークンのプロンプトのコストは、最新のサービス スタックでは 150 トークンのプロンプトよりもわずかに高くなります。デコードでは一度に 1 つのトークンが生成され、それぞれのトークンがモデルの重みを完全に通過する必要があるため、出力の長さはエネルギーをほぼ線形にスケールします。実際的な結果は、プロンプトにより多くのコンテキストを詰め込むのは比較的安価で、モデルをランブルさせるのは高価であるということです。これは、ほとんどのチームが最初に抱く直感とは正反対であり、プロバイダーも入力に対して割引料金を請求しますが、10 倍には遠く及ばないため、価格シートの形成方法とは真逆です。
推論層は足跡が消える場所です
推論モデルの思考軌跡が出力されます。目に見える答えとまったく同じようにデコーダーを通過しますが、ユーザーに到達することはありません。 2,000 個のトークンの審議後に 200 個の可視トークンを生成するリクエストは 2,200 個のトークンを生成し、そのモデルも中間層の代替モデルよりもトークンあたり 1 桁大きい場合、リクエストあたりのエネルギーは、同じタスクに直接応答する場合よりも 50 倍高くなる可能性があります。上記のモデルクラス テーブルを独自のボリュームで実行すると、算術演算は非常に複雑になります。これは、最も扱いやすい手段でもあります。単純なリクエストをより小さな層にルーティングし、必要なケースのために推論を保留することで、請求額とフットプリントの両方を一度に削減します。と取引できるサイズ モデル ルーティングの節約計算ツール、そして、思考トークンがドル換算でいくらかかるかを確認してください。 推論トークンコスト計算ツール.
エネルギーは支払う金額の次の四捨五入誤差です - それがポイントです
デフォルトの数値を実行すると、数千単位の API 請求に対して、200 万の中間層リクエストの背後にある電力は数十ドルかかります。それを救うためにプロバイダーを切り替える人は誰もいません。とにかくそれを計算する理由は、エネルギーコストとは異なり、炭素数は最終的にはCSRDまたは顧客アンケートの開示で擁護可能でなければならず、サプライヤーがサービス単位あたりの排出量を尋ねられる調達の会話で使用されることが増えているためです。対象となるのは地域の行です。低炭素グリッド内の同一のコンピューティングは、石炭を多く使用するグリッドでの排出量の 15 分の 1 を排出します。これは、モデルをいくら最適化しても匹敵しません。開示義務自体があなたをここに導いた原因である場合は、周囲のガバナンス プログラムに、 EU AI 法のコンプライアンスコスト計算ツール.