Общие настройки
Вариант А (контроль)
Вариант Б (претендент)
| Метрика | Вариант А | Вариант Б |
|---|
Как составить бюджет A/B-теста LLM
Стоимость модельного эксперимента часто упускается из виду. Для приложений с высоким трафиком даже 7-дневный тест 50/50 с премиальной моделью может стоить на сотни долларов дороже, чем пребывание под контролем. Вычислить дельту до запустите тест, а затем решите, стоит ли качественный сигнал дополнительных затрат.
Практическое правило: Для получения значимого качественного сигнала вам потребуется не менее 200–500 образцов на каждый вариант (мощность 80 %, p = 0,05, обнаружение разницы в 5–10 %). Для приложения с 10 000 запросов в день даже 10%-ное разделение трафика обеспечивает более 500 образцов в день — трехдневного теста вполне достаточно. Работайте дольше, только если вы ищете редкие крайние сбои.
Сначала теневое тестирование: Перед запуском A/B запустите вариант B в теневом режиме (тот же вход, выходы отброшены). Это стоит денег, но не оказывает никакого влияния на пользователей и позволяет обнаружить катастрофические сбои до того, как они повлияют на реальных пользователей.
Связанный: Калькулятор оценки LLM · Трекер расходов с помощью ИИ · Планировщик бюджета API
Часто задаваемые вопросы
Сколько стоит A/B-тестирование двух моделей LLM?
Стоимость = (запросы × разделение_трафика × токены_за_запрос × цена_за_токен) для каждого варианта. Разделение 50/50 с 10 000 ежедневных запросов, 1000 токенов каждый и моделями по цене 3/15 долларов США против 0,15 долларов США/0,60 долларов США за 1 миллион токенов будет стоить ~ 90 долларов США в день против ~ 3,75 долларов США в день для 7-дневного теста.
Каков минимальный размер выборки для статистически достоверного A/B-теста LLM?
Для большинства показателей качества LLM вам потребуется не менее 200–500 образцов на каждый вариант, чтобы обнаружить разницу в 5–10 % с мощностью 80 % при p=0,05. Для более выраженных различий (2–3%) вам может потребоваться 1000–2000 образцов на каждый вариант.
Как выбрать разделение трафика для A/B-тестирования LLM?
Начните с 10/90 или 20/80, если новая модель не тестировалась. Перейдите к 50/50, если уверены, что новая модель не хуже. Никогда не проверяйте новую модель на 100% без предварительного теневого теста.
Должен ли я сначала провести A/B-тестирование подсказок или моделей?
Сначала протестируйте подсказки — они могут меняться и могут существенно повлиять на качество. Как только у вас будет стабильное лучшее предложение для каждой модели, сравните модели.
Какие показатели мне следует отслеживать в A/B-тесте LLM?
Отслеживание: показатель успешности выполнения задачи, задержка (p50/p95), длина вывода, стоимость успешного вывода и выборка для оценки человеком. Избегайте использования одного LLM для оценки другого члена одной семьи — используйте другую модель судьи или оценщиков-людей.