Impostazioni condivise

Variante UN (controllare)

Variante B (sfidante)

Metrico Variante A Variante B

Come pianificare un test A/B LLM

Il costo di un esperimento modello viene spesso trascurato. Per le applicazioni ad alto traffico, anche un test 50/50 di 7 giorni con un modello premium può costare centinaia di dollari in più rispetto al mantenimento del controllo. Calcola il delta Prima iniziare il test, quindi decidere se il segnale di qualità vale la spesa extra.

Regola pratica: Sono necessari almeno 200–500 campioni per variante per un segnale di qualità significativo (80% di potenza, p=0,05, rilevamento di una differenza del 5–10%). Per un'app da 10.000 richieste al giorno, anche una suddivisione del traffico del 10% fornisce oltre 500 campioni al giorno: un test di 3 giorni è sufficiente. Funziona più a lungo solo se stai cercando rari guasti limite.

Prima il test dell'ombra: Prima del live A/B, esegui la variante B in modalità shadow (stesso input, output scartati). Ciò costa denaro ma non ha alcun impatto sull'utente e consente di individuare guasti catastrofici prima che colpiscano gli utenti reali.

Imparentato: Calcolatore dei costi di valutazione LLM · Monitoraggio della spesa tramite intelligenza artificiale · Pianificatore del budget API

Domande frequenti

Quanto costa testare A/B due modelli LLM?

Costo = (richieste × traffico_divisione × token_per_richiesta × prezzo_per_token) per ciascuna variante. Una suddivisione 50/50 con 10.000 richieste giornaliere, 1.000 token ciascuna e modelli a $ 3/$ 15 contro $ 0,15/$ 0,60 per 1 milione di token costerebbe ~$ 90/giorno contro ~$ 3,75/giorno per un test di 7 giorni.

Qual è la dimensione minima del campione per un test LLM A/B statisticamente valido?

Per la maggior parte dei parametri di qualità LLM, sono necessari almeno 200–500 campioni per variante per rilevare una differenza del 5–10% con una potenza dell'80% a p=0,05. Per differenze più strette (2–3%), potrebbero essere necessari 1.000–2.000 campioni per variante.

Come faccio a scegliere una suddivisione del traffico per i test A/B LLM?

Inizia con 10/90 o 20/80 se il nuovo modello non è stato testato. Passa al 50/50 una volta che sei sicuro che il nuovo modello non sia peggiore. Non dare mai il 100% al nuovo modello senza prima eseguire un test ombra.

Dovrei prima testare i prompt o i modelli A/B?

Testare prima i prompt: sono liberi di cambiare e possono influire notevolmente sulla qualità. Una volta che hai un suggerimento migliore stabile per ciascun modello, confronta i modelli.

Quali metriche dovrei monitorare in un test A/B LLM?

Traccia: percentuale di successo dell'attività, latenza (p50/p95), durata dell'output, costo per output riuscito e un campione di valutazione umana. Evita di utilizzare un LLM per giudicarne un altro nella stessa famiglia: utilizza un modello di giudice diverso o valutatori umani.

Condividi: 𝕏 Pubblica Reddit
Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Calcolatore dei costi di archiviazione DB vettorialeCalcolatore da parole a tokenCalcolatore dei costi dell'API VisionCalcolatore dei costi Self-Host e APICalcolatore dei costi di inferenza GPU