Общие настройки

Вариант А (контроль)

Вариант Б (претендент)

Метрика Вариант А Вариант Б

Как составить бюджет A/B-теста LLM

Стоимость модельного эксперимента часто упускается из виду. Для приложений с высоким трафиком даже 7-дневный тест 50/50 с премиальной моделью может стоить на сотни долларов дороже, чем пребывание под контролем. Вычислить дельту до запустите тест, а затем решите, стоит ли качественный сигнал дополнительных затрат.

Практическое правило: Для получения значимого качественного сигнала вам потребуется не менее 200–500 образцов на каждый вариант (мощность 80 %, p = 0,05, обнаружение разницы в 5–10 %). Для приложения с 10 000 запросов в день даже 10%-ное разделение трафика обеспечивает более 500 образцов в день — трехдневного теста вполне достаточно. Работайте дольше, только если вы ищете редкие крайние сбои.

Сначала теневое тестирование: Перед запуском A/B запустите вариант B в теневом режиме (тот же вход, выходы отброшены). Это стоит денег, но не оказывает никакого влияния на пользователей и позволяет обнаружить катастрофические сбои до того, как они повлияют на реальных пользователей.

Связанный: Калькулятор оценки LLM · Трекер расходов с помощью ИИ · Планировщик бюджета API

Часто задаваемые вопросы

Сколько стоит A/B-тестирование двух моделей LLM?

Стоимость = (запросы × разделение_трафика × токены_за_запрос × цена_за_токен) для каждого варианта. Разделение 50/50 с 10 000 ежедневных запросов, 1000 токенов каждый и моделями по цене 3/15 долларов США против 0,15 долларов США/0,60 долларов США за 1 миллион токенов будет стоить ~ 90 долларов США в день против ~ 3,75 долларов США в день для 7-дневного теста.

Каков минимальный размер выборки для статистически достоверного A/B-теста LLM?

Для большинства показателей качества LLM вам потребуется не менее 200–500 образцов на каждый вариант, чтобы обнаружить разницу в 5–10 % с мощностью 80 % при p=0,05. Для более выраженных различий (2–3%) вам может потребоваться 1000–2000 образцов на каждый вариант.

Как выбрать разделение трафика для A/B-тестирования LLM?

Начните с 10/90 или 20/80, если новая модель не тестировалась. Перейдите к 50/50, если уверены, что новая модель не хуже. Никогда не проверяйте новую модель на 100% без предварительного теневого теста.

Должен ли я сначала провести A/B-тестирование подсказок или моделей?

Сначала протестируйте подсказки — они могут меняться и могут существенно повлиять на качество. Как только у вас будет стабильное лучшее предложение для каждой модели, сравните модели.

Какие показатели мне следует отслеживать в A/B-тесте LLM?

Отслеживание: показатель успешности выполнения задачи, задержка (p50/p95), длина вывода, стоимость успешного вывода и выборка для оценки человеком. Избегайте использования одного LLM для оценки другого члена одной семьи — используйте другую модель судьи или оценщиков-людей.