自己ホスト型推論のコストは、トークンごとの GPU 時間です。 投機的デコードでは出力を変更せずに 1 秒あたりのトークン数が増加するため、トークンあたりのコストが下がりますが、これはドラフトが十分に正確で、受け入れられたトークンが追加のドラフト パスを上回る場合に限ります。請求書に反映されるのは、見出しではなくネットの高速化です。
ベースラインと推測
単純な自己回帰デコードは、ターゲット パスごとに 1 つのトークンです。投機的デコードは、ネットの高速化によってスループットを向上させ、ネットのスピードアップが 1 倍をクリアする限り、それに伴ってトークンあたりのコストも下がります。
| モード | スループット (tok/秒) | コスト/100万 | 月額料金 |
|---|
受け入れ率に対する感度
すべてを決定する唯一の数字は、ドラフトがどれだけ正しい推測をするかということです。ドラフトの深さとオーバーヘッドの損益分岐点合格率を下回ると、投機的なデコードは純損失となります。
| 合格率 | トークン/パス | ネットの高速化 | 月額料金 |
|---|
受け入れられた推測がほぼ無料である理由
一度に 1 つのトークンをデコードする大規模なモデルは、メモリ帯域幅によってボトルネックになります。すべての単一のトークンには、GPU を介して重みセット全体をストリーミングする必要があり、その固定コストによって演算が矮小化されます。投機的解読の背後にある賢明な観察は、 k 1 回のフォワード パスで提案されたトークンのコストは、単一のトークンをデコードするのとほぼ同じです。どちらの方法でも重みを 1 回ストリーミングします。したがって、安価なドラフトモデルが少数のトークンを提案し、大手モデルがそれらのほとんどを受け入れた場合、1 つのトークンの価格で複数のトークンを入手することになります。ターゲットは依然としてすべてのトークンをチェックし、生成されなかったものはすべて拒否するため、出力は通常のデコードと同じです。スループットのみが変化します。セルフホスト型推論では、基本的に GPU 時間を生成されたトークンで割ったものが請求額となり、GPU 秒あたりのトークンが増えればすぐにお金になります。
数式と大きなオーバーヘッド
トークンごとの受け入れ率の場合 ある そしてドラフトの深さ k、検証パスごとにターゲットが発行すると予想されるトークンは次のとおりです。 E = (1 − ak+1) ÷ (1 − a) — 受け入れられた推測の幾何学的な実行と 1 つのボーナス トークン。それが生のスピードアップです。問題はドラフト自体です。ドラフトはサイクルごとに k 回の小さなフォワードパスを実行するため、ドラフトのコストが数分の一になる場合があります。 c パスごとのターゲットの数、各サイクルには実際にコストがかかります 1+k・c ターゲットと同等のユニット。の 正味の速度向上は E ÷ (1 + k·c)、トークンあたりのコストは下がります 1 − 1 ÷ ネットスピードアップ。 a が低く、k・c が線形に増加する一方で E がゆっくりと増加するワークロードで k を高くしすぎると、正味の速度向上は 1 倍に近づき、それを超えて低下します。これが、このツールが保護する失敗モードです。明らかに間違っているドラフトは、まったくドラフトがないよりも悪いのです。
どこに当てはまるか
投機的デコードは、API のレバーではなく自己ホスティングのレバーです。ホストされたプロバイダーはすでに価格を設定しているため、GPU を実行するときにのみキャプチャーされます。とペアリングします GPUクラウドコスト計算ツール 高速化しているハードウェアの価格を決定するには、 LLM VRAM および同時実行計算ツール バッチ処理がそれとどのように相互作用するかを確認します。 セルフホスト型と API の計算ツール そもそも、独自のモデルを実行することがトークンごとに支払うことに勝るかどうかを判断します。関連するトリックとしては、 より小さなモデルを抽出する、ターゲット自身のコストを加速するのではなく削減します - 2 つはスタックします。
この計算機の仕組み
ターゲット検証パスごとに予想されるトークンを計算します。E = (1 − ak+1)/(1 − a)、受け入れ率 a とドラフト深さ k から、ドラフトのパスごとのオーバーヘッド c 後の正味速度向上 E/(1 + k·c)。 100 万あたりのベースラインコストは、GPU ドル/時間 ÷ (スループット × 3600) × 1,000,000 です。投機コストはそれを正味の速度向上で割ります。月額コストは各レートでの出力トークンの量であり、節約額はその差であり、ネットスピードアップが 1 倍を下回る構成にはネット損失としてフラグが立てられます。
よくある質問
投機的デコードとは何ですか?なぜコストが節約されるのですか?
小さなドラフト モデルは、大きなモデルが 1 回のパスで検証するトークンを提案します。受け入れられている推測では、ほぼ無料のスループットです。自己ホスト型推論では、コストはトークンあたりの GPU 時間であるため、ターゲットがすべてのトークンをチェックするため、スループットが高くなると、出力が同じで 100 万あたりのコストが低くなります。
ネット速度向上はどのように計算されますか?
検証パスあたりの予期されるトークン E = (1 − a^(k+1))/(1 − a) をドラフト オーバーヘッド 1 + k·c で割ったもの。トークンあたりのコストは 1 − 1/netSpeedup だけ低下します。
いつお金が失われるのでしょうか?
受け入れが低く、ドラフトの深さが高い場合、k 個の追加のドラフト パスのコストが受け入れられたトークンの節約よりも大きくなり、正味の速度向上は 1 倍を下回ります。このツールはそのケースにフラグを立てます。