—オールウェイズプレミアム / 月
—貯蓄
—損益分岐点の拡大
カスケードコストはどこから来るのか
安価なモデルと検証者は全額が支払われます。プレミアム モデルは、エスカレーションされたシェアに対してのみ支払われます。比較のために、常時プレミアムとプレーンのトラフィック分割が示されています。
エスカレーション率全体にわたる節約
エスカレーション率は変動要因です。これにより、他のすべてが固定され、カスケードがどこで常にプレミアムを上回るのを停止するかを示すためにステップを実行します。つまり、損益分岐点行がマークされます。
まず安いモデルはデフォルトでは安い請求額ではありません
カスケードの魅力は明らかです。ほとんどのリクエストは簡単で、小規模なモデルで適切に処理できます。簡単な作業のために割増料金を支払うのは無駄です。最初に安価なモデルを実行し、チェックに合格した回答を保持し、失敗したものだけをエスカレーションします。FrugalGPT の結果は、これにより、わずかなコストでフロンティア モデルの品質に匹敵することができることを示しました。罠は、安価なモデルを全額コストとして扱うことです。応答が存続するかどうかに関係なく、リクエストごとに料金を支払います。リクエストごとに検証者に料金を支払うことになります。なぜなら、何がエスカレートするかを決定する必要があり、その何かが通常は別のモデル呼び出しであるためです。そして、エスカレーションした分については、すでに行った安価な試みに加えて、プレミアム モデルを支払うことになります。これらを合計すると、状況が変わります。エスカレーションが低いときはカスケードが大幅に節約され、エスカレーションが上昇すると縮小します。損益分岐点を超えると、すべてにおいてプレミアム モデルを呼び出すよりも費用がかかります。なぜなら、安価なモデルとベリファイアには何も支払わず、それでもプレミアム価格を全額支払っているからです。この計算ツールは、独自のトークン数とレートから 3 つのレッグすべての価格を計算し、カスケードを常時プレミアムおよび二重支払いのない通常のトラフィック分割と比較し、算術演算が反転するエスカレーション レートをマークします。各リクエストをエスカレーションするのではなく、事前に単一のモデルにルーティングする場合は、その価格に モデルルーター計算機;キャッシュ、バッチ処理、その他のレバーを上に積み重ねるには、 コスト最適化計算ツール; 2 つのモデル自体を比較するには、 モデル比較.
モデルルーターコストの最適化自己一貫性モデルの比較
この計算機の仕組み
これは、各モデルのリクエストごとのコスト、つまり入力トークンと入力価格と出力トークンと出力価格を掛けて、100 万で割った値から始まります。安価なモデルとベリファイアはリクエスト量全体に基づいて請求されるため、月額コストはリクエストあたりの数値と月あたりのリクエストの積になります。プレミアム モデルはエスカレーションされたシェアに対してのみ請求されるため、月額コストは、リクエストごとのプレミアム コストとリクエストとエスカレーション レートを掛けたものとなります。カスケードの月額コストは、3 つすべての合計です。常時プレミアムは、単純にリクエストごとのプレミアムコストに全ボリュームを掛けたものです。単純なトラフィック分割 (比較のために示したもの) では、エスカレートされていないシェアで安価なモデルに支払い、エスカレートされたシェアでプレミアム モデルに支払いが行われますが、両方が支払われることはありません。節約額は、オールウェイズ プレミアムに比べて 1 マイナス カスケードです。損益分岐点エスカレーション率は、リクエストあたりのチープ プラス ベリファイアのコストとリクエストあたりのプレミアム コストの比を 1 から引いたものです。これより下ではカスケードが常にプレミアムを上回りますが、それより上ではチープファースト アテンプトとベリファイアがデッド ウェイトであり、プレミアムに直接移行する方が安価です。このモデルでは、エスカレーションされたリクエストが両方のモデルで同じトークン数を使用することを前提としています。プレミアム コールが長い場合は、それを反映するためにプレミアム トークンの数を増やします。
よくある質問
LLM カスケードとは何ですか?また、どのようにコストを節約しますか?
各リクエストには、それを処理できる最も安価なモデルで応答します。つまり、安価なモデルが最初に実行され、検証者がその答えが十分であるかどうかを判断し、失敗した場合のみプレミアム モデルにエスカレートします。ほとんどの要求は簡単なので、安価なモデルでは数分の 1 のコストで要求をクリアできます。節約は現実的ですが、それでも、リクエストごとに安価なモデルとベリファイアに加えて、エスカレーションされたシェアに対するプレミアムを支払うことになります。
カスケードは 2 つのモデル間のルーティングとどう違うのですか?
ルーターは前もって 1 つのモデルを選択するため、各リクエストは 1 つのモデルの料金を支払い、二重に支払うことはありません。ただし、ルートが間違っていると、間違った回答が送信されます。カスケードはすべてに対して安価なモデルを実行し、失敗をエスカレートするため、エスカレートされたリクエストには安価なプラス検証者プラスプレミアムが支払われますが、すべてのハード リクエストには適切な 2 回目の試行が行われます。このツールは、両方のコストを同じエスカレーション率で表示します。
カスケードはどのようなエスカレーション レートで保存を停止しますか?
損益分岐点エスカレーション率 - 格安プラスベリファイアのリクエストあたりのコストとプレミアムなリクエストあたりのコストの比を 1 から引いたもの。その下ではカスケードが常にプレミアムを打ちます。それを超えると、ほとんどメリットのない安価なモデルとベリファイアを支払い、それでもプレミアムを全額支払ったことになるため、プレミアムに直接電話した方が安くなります。小規模なモデルと検証器が安価であればあるほど、カスケードが損失に変わる前に、より高いエスカレーションが可能になります。
検証者のコストとして何が考慮されますか? それがなぜ重要ですか?
検証者は、出荷またはエスカレーションを決定するもの (小規模な判定モデル、自己一貫性パス、埋め込みしきい値など) であり、すべてのリクエストで実行されるため、取るに足らないように見える呼び出しごとのコストが大量に加算されます。また、下限も設定されます。エスカレーションがゼロの場合でも、安価なモデルとボリューム全体の検証者に料金を支払います。この計算機は、それをゼロに丸めるのではなく、第一級の入力として扱います。