Geteilte Einstellungen
Variante A (Kontrolle)
Variante B (Herausforderer)
| Metrisch | Variante A | Variante B |
|---|
So budgetieren Sie einen LLM-A/B-Test
Die Kosten eines Modellversuchs werden oft übersehen. Bei Anwendungen mit hohem Datenverkehr kann selbst ein 7-tägiger 50/50-Test mit einem Premium-Modell Hunderte von Dollar mehr kosten, als wenn man die Kontrolle behält. Berechnen Sie das Delta vor Beginnen Sie mit dem Test und entscheiden Sie dann, ob das Qualitätssignal den Mehraufwand wert ist.
Praktische Regel: Sie benötigen mindestens 200–500 Proben pro Variante für ein aussagekräftiges Qualitätssignal (80 % Leistung, p=0,05, Erkennung eines Unterschieds von 5–10 %). Bei einer App mit 10.000 Anfragen/Tag liefert selbst eine Traffic-Aufteilung von 10 % mehr als 500 Beispiele pro Tag – ein dreitägiger Test ist ausreichend. Laufen Sie nur dann länger, wenn Sie auf der Suche nach seltenen Edge-Case-Fehlern sind.
Zuerst den Schattentest: Führen Sie vor Live-A/B Variante B im Schattenmodus aus (gleiche Eingabe, Ausgaben verworfen). Dies kostet Geld, hat aber keine Auswirkungen auf die Benutzer und ermöglicht es Ihnen, katastrophale Ausfälle zu erkennen, bevor sie tatsächliche Benutzer beeinträchtigen.
Verwandt: Kostenrechner für die LLM-Bewertung · KI-Ausgaben-Tracker · API-Budgetplaner
Häufig gestellte Fragen
Wie viel kostet es, zwei LLM-Modelle einem A/B-Test zu unterziehen?
Kosten = (Anfragen × Traffic_Split × Tokens_per_Request × Preis_per_Token) für jede Variante. Eine 50/50-Aufteilung mit 10.000 täglichen Anfragen, jeweils 1.000 Token und Modellen zu 3 $/15 $ gegenüber 0,15 $/0,60 $ pro 1 Mio. Token würde bei einem 7-Tage-Test etwa 90 $/Tag gegenüber etwa 3,75 $/Tag kosten.
Was ist die Mindeststichprobengröße für einen statistisch gültigen LLM-A/B-Test?
Für die meisten LLM-Qualitätsmetriken benötigen Sie mindestens 200–500 Stichproben pro Variante, um einen Unterschied von 5–10 % mit 80 % Trennschärfe bei p=0,05 zu erkennen. Für kleinere Unterschiede (2–3 %) benötigen Sie möglicherweise 1.000–2.000 Proben pro Variante.
Wie wähle ich eine Traffic-Aufteilung für LLM-A/B-Tests aus?
Beginnen Sie mit 10/90 oder 20/80, wenn das neue Modell noch nicht getestet wurde. Steigen Sie auf 50/50 um, sobald Sie sicher sind, dass das neue Modell nicht schlechter ist. Geben Sie niemals 100 % auf das neue Modell, ohne vorher einen Schattentest durchgeführt zu haben.
Sollte ich Eingabeaufforderungen oder Modelle zuerst einem A/B-Test unterziehen?
Testen Sie zunächst die Eingabeaufforderungen – sie können beliebig geändert werden und können sich erheblich auf die Qualität auswirken. Sobald Sie für jedes Modell eine stabile beste Eingabeaufforderung haben, vergleichen Sie die Modelle.
Welche Kennzahlen sollte ich in einem LLM-A/B-Test verfolgen?
Verfolgen Sie: Aufgabenerfolgsrate, Latenz (p50/p95), Ausgabelänge, Kosten pro erfolgreicher Ausgabe und eine menschliche Evaluierungsstichprobe. Vermeiden Sie es, einen LLM zu verwenden, um einen anderen in derselben Familie zu beurteilen – verwenden Sie ein anderes Richtermodell oder menschliche Bewerter.