自己ホスト型推論のコストは、トークンごとの GPU 時間です。 投機的デコードでは出力を変更せずに 1 秒あたりのトークン数が増加するため、トークンあたりのコストが下がりますが、これはドラフトが十分に正確で、受け入れられたトークンが追加のドラフト パスを上回る場合に限ります。請求書に反映されるのは、見出しではなくネットの高速化です。

ドラフト ≈ ターゲットよりも 10 ~ 20 倍小さいモデル
トークン/検証パス (生)
ネットの高速化
コスト / 1M (仕様あり)
毎月の貯蓄

ベースラインと推測

単純な自己回帰デコードは、ターゲット パスごとに 1 つのトークンです。投機的デコードは、ネットの高速化によってスループットを向上させ、ネットのスピードアップが 1 倍をクリアする限り、それに伴ってトークンあたりのコストも下がります。

モードスループット (tok/秒)コスト/100万月額料金

受け入れ率に対する感度

すべてを決定する唯一の数字は、ドラフトがどれだけ正しい推測をするかということです。ドラフトの深さとオーバーヘッドの損益分岐点合格率を下回ると、投機的なデコードは純損失となります。

合格率トークン/パスネットの高速化月額料金
⚠️ モデル、2026 年 7 月。スループットと GPU レートは、メモリ帯域幅制限のあるデコードの編集可能な参考数値です。実数は、モデル、量子化、バッチ サイズ、およびサービング スタック (vLLM、TGI、TensorRT-LLM) によって異なります。受け入れ率はワークロードとドラフトに応じて異なります。トラフィックで測定してください。コスト モデルは、デコードが支配的であり、k+1 位置にわたるターゲット前方パスには約 1 トークン デコードのコストがかかると想定しています。これは、単一/低遅延の待ち時間制限のあるサービスの場合に当てはまります。大量のバッチ処理によりゲインが狭まります。 · 問題を報告する →

受け入れられた推測がほぼ無料である理由

一度に 1 つのトークンをデコードする大規模なモデルは、メモリ帯域幅によってボトルネックになります。すべての単一のトークンには、GPU を介して重みセット全体をストリーミングする必要があり、その固定コストによって演算が矮小化されます。投機的解読の背後にある賢明な観察は、 k 1 回のフォワード パスで提案されたトークンのコストは、単一のトークンをデコードするのとほぼ同じです。どちらの方法でも重みを 1 回ストリーミングします。したがって、安価なドラフトモデルが少数のトークンを提案し、大手モデルがそれらのほとんどを受け入れた場合、1 つのトークンの価格で複数のトークンを入手することになります。ターゲットは依然としてすべてのトークンをチェックし、生成されなかったものはすべて拒否するため、出力は通常のデコードと同じです。スループットのみが変化します。セルフホスト型推論では、基本的に GPU 時間を生成されたトークンで割ったものが請求額となり、GPU 秒あたりのトークンが増えればすぐにお金になります。

数式と大きなオーバーヘッド

トークンごとの受け入れ率の場合 ある そしてドラフトの深さ k、検証パスごとにターゲットが発行すると予想されるトークンは次のとおりです。 E = (1 − ak+1) ÷ (1 − a) — 受け入れられた推測の幾何学的な実行と 1 つのボーナス トークン。それが生のスピードアップです。問題はドラフト自体です。ドラフトはサイクルごとに k 回の小さなフォワードパスを実行するため、ドラフトのコストが数分の一になる場合があります。 c パスごとのターゲットの数、各サイクルには実際にコストがかかります 1+k・c ターゲットと同等のユニット。の 正味の速度向上は E ÷ (1 + k·c)、トークンあたりのコストは下がります 1 − 1 ÷ ネットスピードアップ。 a が低く、k・c が線形に増加する一方で E がゆっくりと増加するワークロードで k を高くしすぎると、正味の速度向上は 1 倍に近づき、それを超えて低下します。これが、このツールが保護する失敗モードです。明らかに間違っているドラフトは、まったくドラフトがないよりも悪いのです。

どこに当てはまるか

投機的デコードは、API のレバーではなく自己ホスティングのレバーです。ホストされたプロバイダーはすでに価格を設定しているため、GPU を実行するときにのみキャプチャーされます。とペアリングします GPUクラウドコスト計算ツール 高速化しているハードウェアの価格を決定するには、 LLM VRAM および同時実行計算ツール バッチ処理がそれとどのように相互作用するかを確認します。 セルフホスト型と API の計算ツール そもそも、独自のモデルを実行することがトークンごとに支払うことに勝るかどうかを判断します。関連するトリックとしては、 より小さなモデルを抽出する、ターゲット自身のコストを加速するのではなく削減します - 2 つはスタックします。

プロジェクトをホストします。DigitalOcean — $200 無料 ↗ホスティンガー VPS
GPU クラウドのコストLLM VRAM と同時実行性セルフホスト型と APIモデル蒸留 ROI

交換

バイビットバイナンスOKXクーコイン

ツールとホスティング

📈 TradingViewホスティンガー

この計算機の仕組み

ターゲット検証パスごとに予想されるトークンを計算します。E = (1 − ak+1)/(1 − a)、受け入れ率 a とドラフト深さ k から、ドラフトのパスごとのオーバーヘッド c 後の正味速度向上 E/(1 + k·c)。 100 万あたりのベースラインコストは、GPU ドル/時間 ÷ (スループット × 3600) × 1,000,000 です。投機コストはそれを正味の速度向上で割ります。月額コストは各レートでの出力トークンの量であり、節約額はその差であり、ネットスピードアップが 1 倍を下回る構成にはネット損失としてフラグが立てられます。

よくある質問

投機的デコードとは何ですか?なぜコストが節約されるのですか?

小さなドラフト モデルは、大きなモデルが 1 回のパスで検証するトークンを提案します。受け入れられている推測では、ほぼ無料のスループットです。自己ホスト型推論では、コストはトークンあたりの GPU 時間であるため、ターゲットがすべてのトークンをチェックするため、スループットが高くなると、出力が同じで 100 万あたりのコストが低くなります。

ネット速度向上はどのように計算されますか?

検証パスあたりの予期されるトークン E = (1 − a^(k+1))/(1 − a) をドラフト オーバーヘッド 1 + k·c で割ったもの。トークンあたりのコストは 1 − 1/netSpeedup だけ低下します。

いつお金が失われるのでしょうか?

受け入れが低く、ドラフトの深さが高い場合、k 個の追加のドラフト パスのコストが受け入れられたトークンの節約よりも大きくなり、正味の速度向上は 1 倍を下回ります。このツールはそのケースにフラグを立てます。