ウェイトは簡単な部分です。 モデルのフィッティングは 1 行の計算であり、ほとんど何もわかりません。 8 人のユーザーにサービスを提供できるか、80 人のユーザーにサービスを提供できるかを決定するのは、KV キャッシュ (コンテキストの長さに応じて拡張されるメモリ) です。 そして 飛行中のすべての同時シーケンスで。このツールは両方のサイズを測定し、得られた容量を API 請求に対して保持できる 100 万トークンあたりのコストに変換します。

重み
同時リクエスト
KVキャッシュ/リクエスト
あなたの$ / 100万トークン

コンテキスト長ごとの同時実行性とユニットコスト

同じモデル、同じ GPU、同じ金額 - 各リクエストのコンテキスト ウィンドウのみが変更されます。これは、「max_model_len を上げるだけ」を容量の決定に変える表です。

コンテクストKV / リクエスト同時トークン/秒の推定値$ / 100万トークン

利用率の崖

GPU はトークンではなく時間単位で請求されます。本当の単価は、見出しの数字をデューティ サイクルで割ったものです。これが、ほとんどのセルフホスティング ビジネス ケースが静かに崩壊する場所です。

平均使用率有効トークン/秒$ / 100万トークン対 API
⚠️ 容量の推定値であり、ベンチマークではありません。 VRAM の数値は、ベンダーがカード メモリを見積もる方法と一致させるために、10 進数の GB (1 GB = 10⁹ バイト) を使用しています。実際のサービング スタックでは、ページ アテンション ブロック パディング、オプションのプレフィックス キャッシュの再利用、スケジューラのヘッドルームが追加されるため、同時実行数を上限として扱い、20 ~ 30% 少なくなるように計画してください。スループットは入力値です。仕様書を信頼するのではなく、独自のハードウェアで測定してください。現在のトークンごとの API レートを比較します。 モデルの価格比較。 · 古い価格を報告する →

モデルをフィッティングすることとモデルを提供することは同じではありません

どこにでもあるアドバイスは、INT4 の 70B モデルには約 35GB が必要なので、1 枚の 80GB カードに余裕を持って収まるということです。それは真実であり、アイドル状態にあるモデルを記述しているため、ほとんど役に立ちません。リクエストが到着すると、実行中のすべてのシーケンスが独自の KV キャッシュを割り当てます。層ごとに 2 つのテンソルがあり、KV ヘッドとヘッドの次元の積でサイズ設定され、そのシーケンスのコンテキスト内のすべてのトークンに対して保持されます。 80 レイヤー、8 KV ヘッド、128 次元、FP16 では、トークンあたり 327,680 バイト (1 メガバイトの 3 分の 1) となり、8K コンテキストでは約 2.7 GB になります。 同時リクエストごと。非常に快適に見える 45GB のヘッドルームには、およそ 12 人のユーザーが収容でき、13 人目はキューに入れられます。推論のためのキャパシティ プランニングは KV キャッシュ プランニングです。ウェイトはエントリー料金を設定するだけです。

KVヘッド数は実際に移動する数です

グループ化されたクエリへの注目こそが、現代のオープンウェイト モデルがそもそも提供可能である理由であり、パラメーター数からハードウェアのサイジングを行う人は、この注目を常に見逃しています。 64 個のアテンション ヘッドと 8 個の KV ヘッドを備えたモデルは、同等のマルチヘッド設計の 8 分の 1 のキャッシュを保存します。これは、同じカード上でほぼ直線的に 8 倍の同時実行性に変換されます。上記の 13B マルチヘッド プリセットを 70B プリセットと比較してみてください。多くの場合、小さいモデルの方が最初にメモリが不足しますが、バイトがどこに行くのかを確認するまでは直感的ではありません。 KV 精度を FP8 に半分にすると、適度な精度コストで同時実行性が再び 2 倍になります。これら 2 つのスイッチは、より大きなカードを購入するよりもはるかに多くの容量を移動でき、費用はかかりません。

ハードウェアではなく、使用率が経済性を決定します

最後のテーブルは、ほとんどの自己ホスティング プロジェクトを正直に終了するテーブルです。 H100 のレンタル料金は、交通量のない午前 3 時にピーク時と同じ 1 時間あたり 2.50 ドルであるため、100 万トークンあたりの実際のコストは、ヘッドラインの数値を平均デューティ サイクルで割ったものとなります。使用率 20% でサービスを提供すると、計算ツールの楽観的な数字が示す金額の 5 倍の料金を支払うことになります。また、小型モデルの汎用 API レートと比較すると、それに近い金額ではありません。セルフホスティングは、持続的で飽和した予測可能なボリューム、API が満たせないデータ常駐やレイテンシの制約があるワークロード、および誰もトークンごとに販売していないモデルで勝利を収めます。突発的なトラフィックで損失が発生することもあれば、請求書がフラットで無駄な容量が品目として表示されないため、静かに損失が発生することもあります。結論をクロスチェックします。 セルフホスト型 LLM と API の計算ツール、ハードウェア自体の価格を GPU推論コスト計算ツール答えが限界に達している場合は、 小型化されたモデル または プロンプトキャッシュ ラックを購入する前に。

プロジェクトをホストします。DigitalOcean — $200 無料 ↗ホスティンガー VPS
セルフホスト型 LLM と APIGPU 推論コストGPU クラウドのコストモデル蒸留 ROILLM レイテンシコンテキストウィンドウのコスト