A/B-тест: что это такое и как провести его шаг за шагом

(нет оценок)
0

A/B-тест сравнивает два варианта одного элемента: страницы, объявления или письма. Один вариант видит половина аудитории, второй вторая половина, а по цифрам выбирают тот, что приводит к цели чаще. Разбираем, как провести тест шаг за шагом, какие инструменты есть в Яндексе и когда эксперимент не нужен.

Контент проверил

Рамазан Миндубаев

Руководитель SEO-отдела TRINET

Дата проверки:

Дата обновления:

Что такое A/B-тест?

A/B-тест, он же сплит-тест, сравнивает два варианта объекта и показывает, какой из них работает лучше при одинаковых условиях. В справочнике Яндекс Рекламы метод описан как способ узнать реакцию людей на изменения в точках взаимодействия с бизнесом, где человек принимает решение или совершает действие. Это может быть заголовок объявления, тема письма, форма заявки или карточка товара.

Аудиторию делят на две случайные группы. Группа A видит текущий вариант, его называют контрольным. Группа B видит изменённый. Дальше сравнивают одну заранее выбранную метрику, например долю заполненных форм, и проверяют, что разница не случайна. Мнение дизайнера или директора в этой схеме заменяют данные.

Разберём пример из продукта. Команда приложения для перелётов хочет добавить онлайн-регистрацию на рейс. Алгоритм случайно отправляет каждого нового пользователя в группу A или B в пропорции 50 на 50. Аналитик заранее уточняет ожидаемый эффект и по нему считает длительность теста. Если один пользователь попал сразу в две группы, тест останавливают и ищут ошибку в алгоритме.

Метод подходит владельцам бизнеса, маркетологам, дизайнерам и тем, кто настраивает рекламу. Чаще всего его применяют в рекламных кампаниях, email-рассылках и при доработке страниц сайта или мобильного приложения. Чтобы получить честный результат, нужны трафик, время и дисциплина: об этом дальше.

Как проходит A/B-тест шаг за шагом

Тест начинается с гипотезы. Идея «давайте перекрасим кнопку» для старта слишком расплывчата. Разбор на Код Медиа предлагает такую форму: если сделать изменение X, то метрика Y изменится на Z, потому что работает механизм M. Без части «потому что» остаётся догадка. Пример из Яндекс Рекламы звучит так: если упростить форму обратной связи, число её заполнений вырастет на 10%.

  1. Сформулируйте гипотезу и выберите одну главную метрику: конверсию в заявку, стоимость лида или долю дошедших до оплаты.
  2. Добавьте защитные метрики, которые не должны просесть, например средний чек.
  3. Рассчитайте размер выборки по базовой конверсии, ожидаемому приросту, уровню значимости и мощности.
  4. Запустите оба варианта одновременно и не меняйте условия до конца.
  5. Сравните результат с заранее заданным порогом и решите: внедрить, доработать или отказаться.

Размер выборки считают в калькуляторах. В Skillbox Media рекомендуют сервисы Mindbox и Evan Miller и отмечают, что для теста обычно берут от 2 до 30% всей аудитории. Пример на скриншоте: при базовой конверсии 20% и ожидаемом приросте 3 процентных пункта калькулятор Mindbox просит 2 791 человека на вариант. Если ждать прирост в 5 пунктов, в калькуляторе Evan Miller получается 1 030 человек на вариант. Чем мельче эффект, тем больше трафика нужно.

Состав групп должен повторять обычную аудиторию. Допустим, на страницу заходят мужчины и женщины в пропорции 20 на 80. Такую же пропорцию сохраняют в обеих группах теста, иначе итог искажается. Запуск лучше назначать на спокойный период без распродаж и громких инфоповодов.

Калькулятор достоверности A/B-тестов Mindbox с размером выборки
Калькулятор Mindbox: при конверсии 20% и приросте 3 пункта нужно по 2 791 человеку на вариант. Источник: mindbox.ru
Калькулятор размера выборки Evan Miller для A/B-теста
Калькулятор Эвана Миллера: для прироста в 5 пунктов хватает 1 030 человек на вариант. Источник: evanmiller.org

Про значимость стоит помнить две цифры. В том же материале стандартный уровень значимости равен 5%, а мощность теста принимают за 80%. Мощность показывает, как часто тест найдёт реальный эффект, если он есть. Остальное зависит от метрики: рекламный клик копится за пару дней, а удержание через месяц после регистрации займёт месяцы.

Какие бывают виды A/B-тестов

Классический вариант: одно изменение и два варианта. Он проще всего в настройке и подходит командам с небольшим трафиком. A/B/n-тест расширяет схему до трёх и более вариантов, например трёх заголовков. Он быстрее ищет подходящий вариант, но требует пропорционально больше трафика, иначе разницу не отличить от шума.

Мультивариантное тестирование меняет несколько элементов страницы одновременно и ищет лучшую комбинацию. Для него нужна высокая посещаемость и более сложный анализ. Отдельная схема, тест с контрольной группой, оставляет часть аудитории совсем без изменений и позволяет чисто оценить эффект нововведения.

Вид тестаСколько вариантовКакой нужен трафикКогда применять
Классический A/B2СреднийОдно изменение, первый тест в команде
A/B/n3 и большеВысокийСравнение нескольких гипотез сразу
Мультивариантный2 и больше по каждому элементуОчень высокийПодбор комбинации элементов страницы
С контрольной группой2СреднийОценка эффекта по сравнению с отсутствием изменений

Новичку лучше начать с классического теста: один элемент, одна метрика, понятный вывод. Правило «одно изменение, один тест» повторяют и справочник Яндекс Рекламы, и разбор Skillbox Media.

Что можно проверять и какой результат ждать

Проверять можно всё, что видит человек перед решением. Примеры по каналам:

  • реклама: заголовки, тексты, картинки, призывы к действию и настройки кампании;
  • письма: тема, прехедер, структура и время отправки;
  • страница сайта: форма, цвет и текст кнопки, расположение блоков, цена и описание продукта;
  • приложение: экраны, интерфейс и новые функции.

Пример из материала Яндекс Рекламы: создают два варианта страницы и смотрят, на какой люди реагируют активнее.

Историю про предвыборную кампанию Барака Обамы рассказал её руководитель аналитики Дэн Сироскер в блоге Optimizely. Команда проверила четыре кнопки и шесть вариантов медиа на странице подписки, всего 24 комбинации, и показала их 310 382 посетителям. Штаб заранее выбрал любимое видео, но все ролики проиграли всем картинкам. Победила кнопка «Learn More» с семейным фото: подписка выросла с 8,26% до 11,6%.

Сироскер оценил этот прирост в 40,6% и пересчитал на всю кампанию. Примерно 10 миллионов подписчиков набрали на этой странице, без теста их было бы около 7,1 миллиона. Эта разница в почти 2,9 миллиона адресов, по его оценке, дала около 288 тысяч дополнительных волонтёров. Выбор, который штаб считал очевидным, оказался ошибочным.

Вторая история из Harvard Business Review, её рассказывают Рон Кохави и Стефан Томке. Сотрудник Bing предложил изменить показ заголовков рекламы. Идею сочли малозначимой, и она лежала в очереди больше полугода, пока инженер не запустил простой тест. За несколько часов выручка выросла так, что сработал сигнал «слишком хорошо, чтобы быть правдой». Проверка показала рост выручки на 12%, а это больше 100 миллионов долларов в год только в США.

Итог теста бывает трёх видов: рост, ничья или падение. Ничья считается обычным исходом, и по итогам многих тестов разницы между вариантами не находят. Тогда изменение внедряют по другим соображениям или формулируют новую гипотезу.

Вывод для маркетолога прикладной: заранее непонятно, какая мелочь сработает. Поэтому тестируют гипотезы по очереди и фиксируют прирост конверсии, как в разборе про конверсию, чтобы сравнивать вклад каждого изменения.

Как запустить тест в Метрике и Директе

В России чаще всего используют Вариокуб, он встроен в Яндекс Метрику. По инструкции Яндекс Рекламы в разделе «Вариокуб» открывают «Эксперименты», подключают код к странице, создают эксперимент и выбирают тип: визуальный редактор, редирект, виджеты, рекламные блоки или флаги. Базовая версия позволяет вести до двух тестов одновременно.

Главная страница Яндекс Метрики с блоком проверки гипотез
Яндекс Метрика: на главной странице сервиса вынесен блок проверки гипотез. Источник: metrica.yandex.ru

Результат читают по цвету: значимые различия подсвечены зелёным или красным, серый означает, что разницы между вариантами люди не заметили. Для первого теста советуют делить аудиторию 50 на 50, а после запуска проверять вариант через блок проверки эксперимента в углу экрана.

Рекламу проверяют в Яндекс Директе. Эксперимент сначала создают в Яндекс Аудиториях, привязывают счётчик Метрики, делят аудиторию, затем копируют кампанию по числу групп, в одной оставляют старые настройки, в других вносят изменения. По словам авторов Skillbox Media, в 98% случаев писать код для теста не нужно: возможностей готовых сервисов хватает. Тест идёт, пока не набрана выборка, и это занимает от нескольких дней до нескольких месяцев.

Статья ppc.world о Вариокубе для A/B-тестов
Разбор экспертов eLama и Kinetica о том, как формулировать гипотезы для Вариокуба. Источник: ppc.world

Маркетолог eLama Вадим Барсов в материале ppc.world советует относиться к идее как к непроверенному факту.

Не женитесь на своих гипотезах.

Вадим Барсов, менеджер по маркетингу агентства eLama, в материале ppc.world

Он же напоминает, что гипотеза должна содержать одно предположение: если менять цвет кнопки и ценностное предложение вместе, по итогам не понять, что именно подействовало.

Когда A/B-тест не нужен?

Тест не сработает при малом трафике. Справочник Яндекс Рекламы называет это главным ограничением: если на страницу приходит мало людей, результаты не покажут реальной картины. Код Медиа даёт ориентир: меньше тысячи целевых событий в неделю уже мало для вывода.

Тест не нужен и тогда, когда проблема очевидна. В руководстве Kariernik приведён пример: если страница падает с ошибкой у трети посетителей, её сначала чинят. Так же с формой, которая просит пятнадцать полей: сократите её и двигайтесь дальше.

Нужен и достаточный поток событий. Если на страницу заходят 500 человек в месяц, а покупает один из ста, это пять покупок в месяц, и значимой разницы между вариантами тест не покажет. В таком случае выручают опросы, записи сессий и юзабилити-тесты.

  • трафика мало, а целевое действие редкое;
  • решение необратимо, например смена платёжного провайдера;
  • проблема очевидна и чинится без проверки;
  • идёт распродажа или другой нетипичный период.

Ещё один случай - необратимые и комплексные решения: смена платёжного провайдера, ребрендинг, новая ценовая политика. Половину аудитории на старой архитектуре не оставить, а сравнить нечего. Тут помогают опросы, записи сессий и сравнение показателей до и после. Не годится и период распродажи или громкого инфоповода: поведение людей в такие дни нетипично.

Какие ошибки портят результат?

Частая ошибка - подглядывание. Команда смотрит на промежуточные цифры, видит победителя и останавливает тест. По расчёту того же издания, если смотреть результат каждый день на протяжении месяца, вероятность хотя бы раз увидеть значимую разницу растёт с 5 до 30%. Там же приведён анализ 2 101 коммерческого теста, который провели исследователи Уортона и Optimizely: около 57% экспериментаторов останавливают тест, как только уверенность достигает 90%.

Вторая группа ошибок техническая. Эксперты Rusbase советуют в первые три дня проверять запуск и воздерживаться от решений. Нужно убедиться, что люди попадают в группы в заданной пропорции: перекос называют Sample Ratio Mismatch. Кеш может показать старую версию страницы, блокировщик рекламы не даёт отправить событие в аналитику, а сбой в cookie перераспределяет человека в другую группу.

Не стоит проверять метрики пачкой. Если смотреть двадцать показателей, вероятность случайно найти значимый результат хотя бы по одному превышает 60%. Чужие гипотезы тоже работают не всегда: то, что сработало в одном проекте, в другом может не дать ничего, поэтому свои идеи берите из своих данных.

Скорость загрузки входит в защитные метрики. В разборе приложения для перелётов замедление страницы всего на секунду снизило важные показатели на 10 - 15%, и пользователям вернули прежнюю версию.

Продуктовый руководитель платформы Trisigma от Авито Искандер Мирмахмадов в том же материале описывает эффект новизны. Новая функция в первые дни собирает аномально много кликов, потом активность падает, поэтому первые дни иногда исключают из анализа. Он же уточняет, что малый трафик не всегда закрывает путь к тесту.

Малый объём трафика не означает, что проводить A/B-тесты невозможно.

Искандер Мирмахмадов, продуктовый руководитель платформы Trisigma от Авито, в том же материале Rusbase

Чтобы не ошибаться, зафиксируйте до старта пять вещей:

  • гипотезу с ожидаемым приростом;
  • одну главную метрику и защитные метрики;
  • размер выборки и срок теста;
  • порог значимости, обычно 5%;
  • правила досрочной остановки: серьёзный сбой или заметный вред для пользователей.

Директор по аналитике «ВКонтакте» Максим Крылов в том же материале считает, что метрики должны отражать реальный путь человека, иначе можно получить рост кликов без роста продаж. Как устроена страница, на которой обычно проверяют гипотезы, описано в разборе про лендинг.

Частые вопросы

Что такое A/B-тест простыми словами?

Это эксперимент, в котором двум случайным группам людей показывают разные версии одной страницы, письма или объявления. Одна группа видит текущий вариант, другая изменённый. Потом сравнивают, какая версия чаще приводит к нужному действию, например к заявке или покупке. Так решение принимают по цифрам и спорят меньше.

Сколько времени должен идти A/B-тест?

До набора заранее рассчитанной выборки. Для частых событий вроде кликов это дни, для заказов недели, для удержания месяцы. Минимальный срок обычно одна-две недели: за это время проходят дневные и недельные колебания трафика. Останавливать тест раньше срока не стоит, даже если первый график выглядит убедительно.

Сколько трафика нужно для теста?

Зависит от базовой конверсии и ожидаемого прироста. Калькулятор покажет число: при конверсии 20% и приросте 3 пункта нужно около 2 800 человек на вариант. Если посетителей мало, выбирайте крупные изменения или качественные методы вроде опросов, записей сессий и юзабилити-тестов, которые дают понимание без статистики.

Чем A/B-тест отличается от мультивариантного?

В A/B-тесте меняют один элемент и сравнивают два варианта. В мультивариантном одновременно меняют несколько элементов и перебирают комбинации, как в истории с кнопками и картинками выше. Второй вариант находит удачное сочетание, но ему нужен существенно больший трафик и более сложный анализ.

Где провести A/B-тест в России?

Для страниц сайта подойдёт Вариокуб в Яндекс Метрике, для рекламы эксперименты в Яндекс Директе через Яндекс Аудитории, для мобильных приложений AppMetrica. Размер выборки и значимость проверяют в калькуляторах Mindbox или Evan Miller. Сбор данных и работу с cookie согласуйте с юристом.


Дата публикации:


Задать вопрос

Оценка материала (необязательно)

Активные ссылки запрещены. Вопрос появится после модерации. Оценку можно поставить отдельно звёздами в шапке.

Вопросы и ответы

Пока нет опубликованных вопросов. Задайте первый — после модерации он появится здесь.


Попробовать AI-Трекер

Оставьте email — откроем доступ и напишем, как проверить видимость бренда.

Загружаем описание источника…

Открыть источник