Configurações compartilhadas
Variante UM (controlar)
Variante B (desafiador)
| Métrica | Variante A | Variante B |
|---|
Como orçar um teste LLM A/B
O custo de um experimento modelo é frequentemente esquecido. Para aplicações de alto tráfego, mesmo um teste 50/50 de 7 dias com um modelo premium pode custar centenas de dólares a mais do que permanecer no controle. Calcule o delta antes iniciando o teste e decida se o sinal de qualidade vale o gasto extra.
Regra prática: Você precisa de pelo menos 200–500 amostras por variante para obter um sinal de qualidade significativo (potência de 80%, p=0,05, detectando uma diferença de 5–10%). Para um aplicativo de 10.000 solicitações/dia, mesmo uma divisão de tráfego de 10% fornece mais de 500 amostras por dia – um teste de 3 dias é suficiente. Execute apenas por mais tempo se estiver procurando por falhas raras em casos extremos.
Teste de sombra primeiro: Antes do A/B ao vivo, execute a variante B no modo sombra (mesma entrada, saídas descartadas). Isso custa dinheiro, mas não tem impacto sobre o usuário e permite detectar falhas catastróficas antes que elas afetem usuários reais.
Relacionado: Calculadora de custo de avaliação LLM · Rastreador de gastos com IA · Planejador de orçamento de API
Perguntas frequentes
Quanto custa testar A/B dois modelos LLM?
Custo = (solicitações × divisão_de_tráfego × tokens_por_solicitação × preço_por_token) para cada variante. Uma divisão 50/50 com 10.000 solicitações diárias, 1.000 tokens cada e modelos de US$ 3/US$ 15 versus US$ 0,15/US$ 0,60 por 1 milhão de tokens custaria aproximadamente US$ 90/dia versus aproximadamente US$ 3,75/dia para um teste de 7 dias.
Qual é o tamanho mínimo da amostra para um teste LLM A/B estatisticamente válido?
Para a maioria das métricas de qualidade LLM, você precisa de pelo menos 200–500 amostras por variante para detectar uma diferença de 5–10% com poder de 80% em p=0,05. Para diferenças mais estreitas (2–3%), você pode precisar de 1.000–2.000 amostras por variante.
Como escolho uma divisão de tráfego para testes LLM A/B?
Comece com 10/90 ou 20/80 se o novo modelo não for testado. Mude para 50/50 quando tiver certeza de que o novo modelo não é pior. Nunca coloque 100% no novo modelo sem primeiro fazer um teste de sombra.
Devo testar prompts ou modelos A/B primeiro?
Teste os prompts primeiro – eles podem ser alterados livremente e podem afetar drasticamente a qualidade. Depois de ter um melhor prompt estável para cada modelo, compare os modelos.
Quais métricas devo acompanhar em um teste LLM A/B?
Rastrear: taxa de sucesso da tarefa, latência (p50/p95), comprimento da saída, custo por saída bem-sucedida e uma amostra de avaliação humana. Evite usar um LLM para julgar outro da mesma família – use um modelo de juiz diferente ou avaliadores humanos.