Impostazioni condivise
Variante UN (controllare)
Variante B (challenger)
| Metrico | Variant A | Variante B |
|---|
Come pianificare un test A/B LLM
The cost of a model experiment is often overlooked. For high-traffic applications, even a 7-day 50/50 test with a premium model can cost hundreds of dollars more than staying on the control. Calculate the delta Prima starting the test, then decide if the quality signal is worth the extra spend.
Regola pratica: Sono necessari almeno 200–500 campioni per variante per un segnale di qualità significativo (80% di potenza, p=0,05, rilevamento di una differenza del 5–10%). Per un'app da 10.000 richieste al giorno, anche una suddivisione del traffico del 10% fornisce oltre 500 campioni al giorno: un test di 3 giorni è sufficiente. Funziona più a lungo solo se stai cercando rari guasti limite.
Prima il test dell'ombra: Prima del live A/B, esegui la variante B in modalità shadow (stesso input, output scartati). Ciò costa denaro ma non ha alcun impatto sull'utente e consente di individuare guasti catastrofici prima che colpiscano gli utenti reali.
Imparentato: Calcolatore dei costi di valutazione LLM · Monitoraggio della spesa tramite intelligenza artificiale · Pianificatore del budget API
Domande frequenti
Quanto costa testare A/B due modelli LLM?
Costo = (richieste × traffico_divisione × token_per_richiesta × prezzo_per_token) per ciascuna variante. Una suddivisione 50/50 con 10.000 richieste giornaliere, 1.000 token ciascuna e modelli a $ 3/$ 15 contro $ 0,15/$ 0,60 per 1 milione di token costerebbe ~$ 90/giorno contro ~$ 3,75/giorno per un test di 7 giorni.
Qual è la dimensione minima del campione per un test LLM A/B statisticamente valido?
Per la maggior parte dei parametri di qualità LLM, sono necessari almeno 200–500 campioni per variante per rilevare una differenza del 5–10% con una potenza dell'80% a p=0,05. Per differenze più strette (2–3%), potrebbero essere necessari 1.000–2.000 campioni per variante.
Come faccio a scegliere una suddivisione del traffico per i test A/B LLM?
Start with 10/90 or 20/80 if the new model is untested. Move to 50/50 once you are confident the new model is not worse. Never put 100% on the new model without a shadow test first.
Dovrei prima testare i prompt o i modelli A/B?
Testare prima i prompt: sono liberi di cambiare e possono influire notevolmente sulla qualità. Una volta che hai un suggerimento migliore stabile per ciascun modello, confronta i modelli.
Quali metriche dovrei monitorare in un test A/B LLM?
Traccia: percentuale di successo dell'attività, latenza (p50/p95), durata dell'output, costo per output riuscito e un campione di valutazione umana. Evita di utilizzare un LLM per giudicarne un altro nella stessa famiglia: utilizza un modello di giudice diverso o valutatori umani.