共有設定
変異体 あ (コントロール)
変異体 B (挑戦者)
| メトリック | バリアント A | バリアント B |
|---|
LLM A/B テストの予算を立てる方法
モデル実験のコストは見落とされがちです。高トラフィックのアプリケーションの場合、プレミアム モデルを使用した 7 日間の 50/50 テストでも、制御を継続するよりも数百ドルの費用がかかる可能性があります。デルタを計算する 前に テストを開始してから、高品質の信号が追加の費用をかける価値があるかどうかを判断します。
実際的なルール: 意味のある品質の信号 (パワー 80%、p=0.05、5 ~ 10% の差を検出) を得るには、バリアントごとに少なくとも 200 ~ 500 のサンプルが必要です。 1 日あたり 10,000 リクエストのアプリの場合、10% のトラフィック分割でも 1 日あたり 500 以上のサンプルが配信されます。3 日間のテストで十分です。まれなエッジケースの障害を探している場合にのみ、より長く実行してください。
最初にシャドウ テストを行います。 ライブ A/B の前に、バリアント B をシャドウ モードで実行します (同じ入力、出力は破棄されます)。これには費用がかかりますが、ユーザーへの影響はゼロで、実際のユーザーに影響を与える前に致命的な障害を発見できます。
関連している: LLM 評価コスト計算ツール · AI支出トラッカー · API予算プランナー
よくある質問
2 つの LLM モデルの A/B テストにかかる費用はどれくらいですか?
各バリアントのコスト = (リクエスト数 × トラフィック分割 × リクエストごとのトークン × トークンごとの価格)。毎日 10,000 件のリクエスト、それぞれ 1,000 トークン、100 万トークンあたり $3/$15 対 $0.15/$0.60 のモデルを 50/50 に分割すると、7 日間のテストの場合、1 日あたり約 90 ドル対 1 日あたり約 3.75 ドルの費用がかかります。
統計的に有効な LLM A/B テストの最小サンプル サイズはどれくらいですか?
ほとんどの LLM 品質メトリクスでは、p=0.05 で 80% の検出力で 5 ~ 10% の差異を検出するには、バリアントごとに少なくとも 200 ~ 500 個のサンプルが必要です。差がより小さい場合 (2 ~ 3%)、バリアントごとに 1,000 ~ 2,000 個のサンプルが必要になる場合があります。
LLM A/B テスト用のトラフィック分割を選択するにはどうすればよいですか?
新しいモデルがテストされていない場合は、10/90 または 20/80 から開始します。新しいモデルの方が悪くないと確信できたら、50/50 に移行します。最初にシャドウ テストを行わずに、新しいモデルに 100% を適用しないでください。
プロンプトまたはモデルを最初に A/B テストする必要がありますか?
最初にプロンプトをテストします。プロンプトは自由に変更でき、品質に劇的な影響を与える可能性があります。各モデルの安定したベスト プロンプトを取得したら、モデルを比較します。
LLM A/B テストではどのような指標を追跡する必要がありますか?
追跡: タスクの成功率、レイテンシー (p50/p95)、出力の長さ、成功した出力ごとのコスト、人間による評価サンプル。ある LLM を使用して同じファミリー内の別の LLM を判断することは避け、別の裁判官モデルまたは人間の評価者を使用します。