フォールバック率がすべてを左右します。 トラフィックの 90% を処理し、残りを教師に返送する抽出モデルでは、最高額の倍数は提供されません。エスカレーションされた 10 分の 1 は完全なフロンティア料金で請求され、通常、残りの請求額の大部分を占めます。以下に正直な数字を入力して、回収期間の推移を観察してください。
フォールバック率が ROI に与える影響
同じ生徒モデル、同じ前払い額 - 教師に戻されるトラフィックの割合のみが変わります。これは、蒸留プロジェクトが四半期にわたって成功するか丸め誤差があるかを決定する変数です。
| フォールバック率 | 効果/月 | 節約/月 | 節約 vs 先生 | 返済 |
|---|
見出しの「20 倍安くなる」という数字が節約にならない理由
蒸留は機能し、公表された倍数は実際のものです。狭い課題に関して大きな教師の真似をするように小さな生徒を訓練すると、トークンあたりのサービスコストは通常 5 ~ 20 倍の間で下がります。これらの数字が示しているのは、教師ではなく生徒を通過するトークンのコストです。彼らが説明していないのは、実稼働システムの実行コストですが、量が異なります。実稼働システムはトラフィックの 100% を、単にほぼ同等に優れたモデルにルーティングするわけではないからです。自信のあるケースを生徒に転送し、残りのケースをエスカレーションします。残りのケースには教師の全額が請求されます。 10% のフォールバック率でも、教師は生徒の料金の 30 倍でボリュームの 10 分の 1 を処理することになります。これは、教師が残りの請求額の大部分を引き続き負担することを意味します。蒸留をクリーン スワップとしてモデル化することは、このようなビジネス ケースで最も一般的なエラーです。
初期費用のほとんどは GPU ではなく人件費です
コンピューティングラインは、ほとんどの場合、最も安価な部分です。教師を通じて 50,000 個の例にラベルを付けるには、通常の料金で数百ドルの費用がかかります。小さな学生の微調整には数十 GPU 時間かかります。商品のレンタル価格に換算するとさらに 100 ドルかかります。次に、どのベンダーのコスト計算ツールにも表示されない部分が発生します。誰かがトレーニング セットを厳選し、受講生が十分に優れているかどうかを実際に判断できる評価ハーネスを構築し、フォールバック ルーターの信頼しきい値を定義し、実稼働トラフィックに対して検証してから、実際のユーザーをそこに移行する必要があります。 40 エンジニアリング時間はその作業の楽観的な見積もりであり、現実的な混合レートでは、これがアップフロント列の他のすべてを圧倒します。そのため、電卓は黙ってゼロのままにするのではなく、明示的にそれを要求します。
あなたがレースしている時計
最後の考慮事項は、スプレッドシートに強制されないことです。フロンティア価格は下落し続けています。 2 か月で投資回収できるプロジェクトは、これに対して安全です。 18 か月で回収できるこのプロジェクトは、教師の価格と小型モデルの状況が 1 年半静止することに賭けているが、最近の歴史によれば、そうなることはないだろう。上記の投資回収額が数四半期を超えて達成された場合、通常は、より安価な既製モデルを購入し、最初に迅速な圧縮またはキャッシュを使用する必要があるというのが正直な見方です。 プロンプトキャッシュ節約計算ツール そして モデル ルーティングの節約計算ツールどちらも、コミットメントの一部でわずかな節約を実現します。蒸留は、大量の、狭い、安定したタスクで生計を立てていますが、それ以外の場所では罰を受けます。 Compare against a straight fine-tune with the 微調整とプロンプト計算の比較、または、モデルを自分で実行することに反対します。 セルフホスト型 LLM と API の計算ツール.