—
評価実行ごとに—モデルごと
—毎月 (毎日実行)
—トークンの合計
裁判官はトークンの請求額を 2 倍にします
LLM-as-judge 評価は生成と採点に料金を支払うため、CI ではトークンが急速に蓄積されます。安いジャッジとタイトなゴールデンセットにより、手頃な価格が保たれています。基になる呼び出しのサイズを設定します。 LLM トークンコスト計算ツール.
LLM-as-judge 評価スイートの実行ごとにかかる費用。
LLM-as-judge 評価は生成と採点に料金を支払うため、CI ではトークンが急速に蓄積されます。安いジャッジとタイトなゴールデンセットにより、手頃な価格が保たれています。基になる呼び出しのサイズを設定します。 LLM トークンコスト計算ツール.
無料の LLM 評価コスト計算ツール — テスト ケース、モデルを比較し、トークンを 1 回の評価実行のコストと比較します。
コストは、各回答を読み取る裁判官モデルを含む、テスト ケース×モデル×ケースごとのトークンです。生成されたすべての回答も採点されるため、裁判官としての LLM はトークンをおよそ 2 倍にします。コミットごとにスイートを実行すると、月全体でその数が倍増します。
より小型で安価なモデルを判断者として使用し、数千のケースではなく焦点を絞ったゴールデン セットを維持し、各コミットでクイック スモーク セットを実行してスイート全体を毎晩実行します。プッシュのたびにすべてのモデルを評価する必要はありません。