Статья / Маркетинг

A/B-тесты в маркетинге: как отделить эффект от шума

Что зафиксировать до запуска теста, как читать разницу конверсий и почему отсутствие значимости не доказывает отсутствие эффекта. Разбор на условном примере с расчётом неопределённости.

Один бумажный свёрток соединён оранжевой нитью с тремя квитанциями, одна из которых загнута назад.

Что именно должен решить тест

Новый заголовок получил больше заявок. Это приятно. Но заявки могли вырасти из-за дня недели, состава аудитории или обычного разброса. A/B-тест помогает оценить эффект изменения: сопоставимые участники случайно получают разные варианты в один и тот же период.

Тест полезен, когда по результату действительно изменится решение. Если оплату сломали, её следует чинить. Если вариантов десять, а покупателей пять в неделю, дробление трафика вряд ли быстро даст ответ.

Сначала сформулируйте сомнение: поможет ли более понятное описание доставки увеличить долю оплаченных покупок? Или упрощение формы даст больше заявок ценой их качества? Это разные вопросы и разные критерии успеха.

До запуска напишите короткий договор с будущим собой

Достаточно одной страницы:

  • какое изменение проверяем и почему оно должно повлиять на поведение;
  • кто участвует и как случайно распределяется по вариантам;
  • основная метрика и точный знаменатель;
  • минимальный эффект, который имеет практическую ценность;
  • объём выборки, длительность и правила остановки;
  • показатели, ухудшение которых неприемлемо.

Последний пункт легко забыть. Конверсия в форму может вырасти, а доля квалифицированных обращений — упасть. Для проверки формы заранее смотрите и дальнейшее качество лидов, и нагрузку на обработку.

Microsoft в материалах о проектировании эксперимента отдельно выделяет проверяемую гипотезу, выбор метрик, единицы рандомизации и достаточность выборки. Pre-Experiment Stage.

Основную метрику выбирайте по решению бизнеса. Для изменения описания доставки это может быть покупка на участника, для формы — квалифицированный лид на участника. Конверсия только среди дошедших до последнего экрана способна исказить ответ, если само изменение влияет на то, кто туда доходит.

Участник должен оставаться в своём варианте

Если сегодня человек видит A, а завтра B, воздействия смешиваются. Выберите достаточно устойчивый идентификатор и сохраняйте назначение. Для некоторых B2B-сценариев единицей будет компания: сотрудники одной организации могут влиять на общее решение.

Единица анализа должна соответствовать устройству теста. Десять посещений одного человека не становятся десятью независимыми участниками. Несколько заказов одного покупателя также нельзя автоматически считать независимыми наблюдениями.

Распределяйте варианты одновременно. При схеме «A утром, B вечером» время становится дополнительным различием между группами. Сравнение недели до изменения с неделей после полезно как наблюдение, но само по себе не заменяет контрольную группу.

Сколько данных понадобится

Выборка зависит от исходной метрики, размера эффекта, который нужно обнаружить, допустимого риска ложного сигнала и мощности. Мощность — вероятность обнаружить заданный реальный эффект при выбранных условиях теста. Она не означает вероятность того, что конкретный положительный результат окажется верным.

Условный ориентир: базовая конверсия 5%, интересующий эффект — рост до 5,5%. Это +0,5 процентного пункта, или +10% относительно исходной конверсии.

Для двух независимых равных групп, двусторонней проверки, уровня значимости 5% и мощности 80% нормальное приближение даёт около 31,3 тыс. участников на вариант. Это расчёт для одной бинарной метрики; повторные наблюдения, кластеризация и другой способ анализа меняют требования.

Если подходящего трафика мало, выбирайте более заметное и осмысленное изменение либо иной метод исследования. Интервью и разбор пользовательских сценариев помогут найти проблему, хотя не дадут такую же оценку причинного эффекта.

Продолжительность должна охватывать важные циклы поведения и время до конверсии. Большая выборка за один необычный день не объясняет, как изменение будет работать в обычную неделю.

Условный результат: плюс 10% с большим вопросом

Допустим, в каждой группе оказалось по 10 000 независимых участников. В A купили 500 человек, в B — 550. Каждый участник учитывается один раз: совершил покупку или нет.

ПоказательAB
Участники10 00010 000
Покупатели500550
Конверсия5%5,5%

Наблюдаемая разница составляет +0,5 п.п. Относительное изменение — (5,5% / 5% − 1) × 100% = +10%.

Для этих условных данных приближённый 95% доверительный интервал разницы, рассчитанный нормальным методом для независимых долей, составляет от −0,12 до +1,12 п.п. Интервал включает ноль, небольшое ухудшение и полезное улучшение. Данных пока недостаточно для уверенного выбора по этому критерию.

Это не доказательство отсутствия эффекта. Тест с малой чувствительностью может не обнаружить важное изменение. Обратная ситуация тоже возможна: огромная выборка выявит настолько маленькую разницу, что внедрение не окупится.

ASA подчёркивает: p-value не измеряет размер эффекта или важность результата. Решение требует оценки контекста и других доказательств. Заявление Американской статистической ассоциации.

Сначала проверьте сам эксперимент

Перед выводом сопоставьте фактическое распределение участников с заданным. При плане 50/50 группы не обязаны совпасть человек в человека. Но слишком большое расхождение относительно размера выборки может указывать на ошибку назначения, потерю событий или фильтрацию одной группы.

Для этого используют проверку Sample Ratio Mismatch, или SRM. Найденное расхождение требует диагностики; случайное удаление лишних участников его причину не исправляет. Microsoft разбирает этот класс ошибок в материале о SRM.

Проверьте также, что события собирались одинаково, участники видели нужный вариант, а время наблюдения достаточно для покупки. Для цепочки после заявки пригодится отдельный анализ воронки.

Не останавливайте тест при первом удобном результате

Следить за поломками и вредом нужно с начала эксперимента. Но привычка ежедневно проверять обычный p-value и завершать тест, как только он стал меньше 0,05, меняет риск ложных выводов.

Для заранее фиксированного теста соблюдайте план. Для решений по ходу наблюдения нужен метод, рассчитанный на последовательный анализ, с предусмотренными правилами остановки. Проверка множества вариантов, метрик и сегментов тоже требует учёта множественных сравнений. Эти вопросы описаны в During-Experiment Stage.

После просмотра данных можно найти новую интересную гипотезу. Её полезно проверить отдельно; объявлять найденный постфактум сегмент заранее запланированной победой не стоит.

Как превратить результат в решение

Рядом с оценкой эффекта поставьте диапазон неопределённости, стоимость внедрения и показатели возможного вреда. Переведите изменение в ожидаемые покупки или маржинальный доход с явными предположениями. Для этого пригодится разбор юнит-экономики.

Если полезный эффект достаточно убедителен и ограничения соблюдены, изменение можно развивать. Если результат отрицательный — разберите механизм. Если диапазон слишком широк — честный вывод состоит в том, что ответ пока не получен.

Для утверждения «существенного эффекта нет» нужны заранее заданные границы практической эквивалентности и подходящий анализ. Один p-value выше 0,05 такую проверку не заменяет.

Сохраните короткую запись: что проверяли, кто участвовал, что изменилось, насколько уверенно и какое решение приняли. Это сделает следующий тест умнее, даже когда текущий не дал победителя.

На что опирается разбор

Ссылки на справки и исследования, использованные в статье. Условия конкретного продукта стоит сверять перед применением.

ОБСУЖДЕНИЕ

Пока тихо. Можно начать.

Загружаю обсуждение…

СЛЕДУЮЩИЙ ШАГ

Что ещё поможет в этой задаче

Маркетинг6 сентября · 6 минут

Маркетинговый аудит: где искать главную проблему

Как разобраться в маркетинге, если отчётов много, а причина слабых продаж непонятна. Сначала проверяем данные и экономику, затем выбираем одно изменение с понятным критерием результата.

Читать разбор
Маркетинг6 сентября · 6 минут

Юнит-экономика рекламы: как связать CAC, ROAS, ДРР и маржу

ROAS может выглядеть прекрасно, пока заказ приносит убыток. Разбираем рекламные показатели через выручку, переменные расходы, новых клиентов и деньги, которые остаются бизнесу.

Читать разбор
Маркетинг6 сентября · 6 минут

Анализ воронки продаж: где теряются клиенты и что проверять

Падение конверсии показывает участок проблемы, но не объясняет причину. Собираем сопоставимую воронку, отделяем незавершённые сделки от потерь и выбираем проверку по конкретному переходу.

Читать разбор