—プレミアム/正しい
—安い/正しい
—損益分岐点の精度
ステッカーの価格と結果の価格
各モデルの価格は 2 つの方法で設定されています。1 つは呼び出しあたりの直接のコスト、もう 1 つは再試行にかかる費用を精度で割った後の実効コストです。 「再試行」列は精度を 1 つ上回るもので、1 つの良い答えを得るまでに平均何回試行が必要かです。正解ごとに最も安い行が強調表示されます。必ずしも最も安いステッカーではありません。
安価なモデルにはどの程度の精度が必要か
プレミアム モデルの正解あたりの固定コストに対して、安価なモデルのさまざまな精度における実効コストが低くなります。それらが交わる行は損益分岐点の精度です。それより上では安価なモデルが勝ち、それより下では再試行によりより高価なモデルになります。
| 精度が低い | より安い $/正しい | プレミアム $/正解 | 勝者 |
|---|
お金がかかる割引
すべてのモデル選択ダッシュボードは 100 万トークンあたりの価格で並べ替えられており、そのすべてが間違った質問に答えています。請求書に請求されるのは通話の料金ではなく、実際に使用できる通話の料金です。タスクの正解と不正解が判明した瞬間、これら 2 つの数字はバラバラになります。呼び出しごとに 30% 安いが、精度が 10 ポイント低いモデルは、30% 安いわけではありません。再試行するか間違いを破棄すると、使用可能な結果ごとにさらに多くの試行を購入することになり、算術演算によりランキングが完全に逆転する可能性があります。修正は 1 つの除算です。試行のコストを取得し、それを試行が成功する確率で割って、それに基づいてモデルを比較します。この計算機が出力する損益分岐点は、単一の数値で決定されます。つまり、再試行で支払う税金ではなく、より安価なモデルが実際の割引になる前にクリアする必要がある精度です。これは、正しいか間違っているかを区別し、単純に失敗を再実行できることを前提としています。これは、テスト スイート、検証者、または人間によるレビューがある場合にまさに当てはまります。間違った答えが検出されずに出荷される場合、安価なモデルはさらに悪いです。なぜなら、下流で間違っているというコストも支払うことになるからです。最初に 1 回の通話の料金を設定します。 トークンコスト計算ツール、生のモデルの価格を比較します。 モデル比較ページコールをエージェントに連鎖させている場合は、フルタスク トークンの書き込みサイズを次のように設定します。 AIエージェントのコスト計算ツール.
トークンコスト価格/性能A/B テストのコストAI エージェントのコストモデルの比較
この計算機の仕組み
各モデルのタスクあたりのコストとその精度を成功率として計算します。正解あたりの有効コストは、タスクあたりのコストを精度の割合で割ったものです。平均すると、良い答えを導き出すために精度の高い試行を 1 回実行し、失敗した試行に対しても料金を支払うことになるからです。毎月の有効支出は、正解あたりのコストに、1 か月あたりに必要な正解数を掛けたものです (1 日あたりの正解数に 30.4 を掛けたもの)。損益分岐点精度は、より安価なモデルのコストとプレミアム モデルのコストの比率によってスケールされた、より高価なモデルの精度です。つまり、より安価なモデルの再試行によって価格の優位性が正確に打ち消される精度です。これは、独立した再試行と、間違った答えを検出するための信頼できる方法を前提としています。検証者がいない場合、実効コストは下限になります。
よくある質問
正解あたりのコストとは何ですか? なぜトークンの価格よりも重要なのでしょうか?
これは、1 回の呼び出しにかかる費用ではなく、1 つの有用な結果を得るために支払う金額です。トークンの価格は、その試みが正しかったかどうかについては何も語っていません。モデルが 70% の確率で成功し、失敗した場合に再試行する場合、適切な回答ごとに約 1.4 回の試行に対して料金が発生するため、実効コストはステッカーを精度で割ったものとなります。この区分により、順位が逆転する可能性があります。呼び出しごとに 40% 安いが精度が低いモデルは、高価で信頼性の高いモデルよりも正解ごとに高価になる可能性があります。
モデルの精度調整後のコストを計算するにはどうすればよいですか?
1 回の呼び出しのコストを成功率で割ります (分数)。 95% で 2 セントは、正解ごとに約 2.1 セントです。 65% で 2 セントは、正常なコールごとに約 1.5 コールが必要となるため、約 3.1 セントになります。乗数は 1 倍の精度です。95% は 1.05 倍の税金、65% は 1.54 倍の税金、50% はコストの 2 倍になります。間違った答えを検出して再試行できることを前提としています。悪い回答が出荷された場合、実際のコストはさらに高くなります。
安価なモデルを実際に安価にするためには、どの程度の精度が必要ですか?
少なくとも、より高価なモデルの精度は価格比によって決まります。プレミアム モデルの精度が 95% で、安価なモデルのコストが 70% である場合、安価なモデルの損益分岐点には最大 66.5% の精度が必要です。それ以下では再試行により節約効果が失われます。それ以上では勝ちです。ヘッドライン割引は、精度の数値が添付されていなければ意味がありません。
これは分類、抽出、エージェントにも適用されますか?
出力が正しいかどうかをスコアリングできる場所ならどこでも。精度は、ラベル付きセットに対する合格率、または正しい結果に達するエージェント実行の割合です。エージェントの場合、その影響は増幅されます。実行が失敗すると、1 回の呼び出しよりもはるかに多くのトークンが消費される可能性があります。オープンエンド生成の場合、受け入れ率 (書き換えなしで維持されるシェア) を精度入力として使用します。