A/B-тест против «изменить и посмотреть»: в чём разница
Когда вы просто меняете что-то на сайте и смотрите, как изменились цифры, вы сравниваете «вчера» с «сегодня». Но трафик не одинаков в разные дни: в понедельник на сайт приходят одни люди, в пятницу — другие. Если конверсия выросла после изменения, возможно, дело в самом изменении. А возможно, в этот день просто пришёл более тёплый трафик, вышел нужный запрос в Яндексе или конкурент остановил рекламу.
A/B-тест устраняет этот изъян с помощью контрольной группы. Трафик делится случайным образом: половина посетителей видит вариант А (текущая версия страницы), а половина видит вариант Б (новая версия). Оба варианта показываются одновременно, в одинаковых условиях. Если вариант Б конвертирует лучше, скорее всего, дело в нём, а не в дне недели.
Ключевое слово: «скорее всего». Даже с контрольной группой результат может быть случайным — при небольшом трафике разница в несколько конверсий легко объясняется статистическим шумом. Поэтому A/B-тест заканчивается не тогда, когда «кажется, что видно результат», а когда накоплено достаточно данных для уверенного вывода.
Детальное определение A/B-теста как метода и его математику разобрали в разделе «Что такое A/B-тест» в базе знаний. Здесь только практика: инструменты, расчёт выборки и типичные ошибки.
Что тестировать: приоритеты и ограничения
Не всё на посадочной странице одинаково влияет на конверсию. Начинайте с элементов, которые большинство посетителей видят и которые напрямую связаны с принятием решения о заявке.
Что тестировать в первую очередь
| Элемент | Почему важен | Примеры гипотез |
|---|---|---|
| Заголовок H1 | Первое, что читает посетитель. Влияет на решение остаться или уйти | «Ремонт квартир под ключ» vs «Ремонт без головной боли: мы берём на себя всё» |
| Кнопка CTA | Финальный шаг перед конверсией. Текст, цвет и позиция влияют на клик | «Оставить заявку» vs «Рассчитать стоимость»; кнопка вверху vs после описания услуги |
| Форма заявки | Меньше полей обычно означает меньше трений, но слишком мало полей снижает качество лида | 3 поля vs 6 полей; форма на первом экране vs форма внизу |
| Главное изображение или видео | Создаёт первое впечатление, особенно для услуг и физических товаров | Фото объекта vs фото команды vs видео процесса |
| Оффер или формулировка цены | Влияет на воспринимаемую ценность. Разные формулировки меняют восприятие | «От 45 000 ₽» vs «Расчёт бесплатно»; цена на видном месте vs скрытая до звонка |
Что не стоит тестировать в рамках A/B
- Несколько элементов одновременно. Если изменить заголовок и цвет кнопки в одном тесте, непонятно, что именно дало результат. Каждый тест проверяет одну переменную.
- Мелочи с микроэффектом. Толщина шрифта, незначительный отступ, оттенок цвета. Чтобы обнаружить разницу в 0,1%, нужен огромный трафик. При малом трафике тест никогда не закончится.
- Структура навигации и архитектура. Это стратегическое решение, которое влияет на весь сайт. Такие изменения требуют качественного исследования, а не A/B-теста на одной странице.
- Элементы, которые видит малая часть пользователей. Футер, боковые колонки на десктопе, скрытые вкладки: тестировать их означает растягивать срок эксперимента без практической пользы.
Инструменты для A/B-тестирования
Выбор инструмента зависит от технических возможностей команды и бюджета.
Яндекс.Метрика: раздел «Эксперименты»
Встроенный инструмент без дополнительной платы. Функциональность реализована через встроенный в Метрику сервис Varioqub (Вариокуб). Работает через JavaScript-код, который вы встраиваете на страницу: он показывает один из вариантов в зависимости от хеша идентификатора пользователя, поэтому один и тот же посетитель всегда видит один вариант. Результаты читаются в отчётах Метрики, где вы уже настроили цели и видите конверсии по каждому варианту.
Главный минус: изменения нужно реализовывать кодом, визуального редактора нет. Для команды с фронтендером это нормально; для владельца без разработчика это серьёзный барьер.
Если вы только начинаете работать с Метрикой, пригодится разбор семи отчётов, которые нужны каждый день: он поможет правильно читать данные теста в интерфейсе системы.
VWO (Visual Website Optimizer)
Визуальный редактор позволяет редактировать текст, менять цвет кнопки и переставлять блоки прямо в браузере без кода. Инструмент сам генерирует вариант и разделяет трафик. Встроенный калькулятор выборки помогает рассчитать нужный объём трафика до запуска теста.
VWO является платным инструментом. Есть бесплатный пробный период, после которого нужна подписка. Подходит командам, которые регулярно тестируют страницы и ценят скорость запуска без участия разработчика.
Optimizely
Корпоративный стандарт для крупных проектов с большим трафиком. Поддерживает сложный таргетинг (показывать вариант только определённой аудитории), мультивариантные тесты, серверные эксперименты. Цены по запросу, ориентирован на enterprise. Для малого и среднего бизнеса избыточен.
Google Optimize: устарел
Если вы встречаете рекомендации использовать Google Optimize, статья написана до 30 сентября 2023 года: Google прекратил поддержку этого инструмента. Заменить его можно VWO, Optimizely или экспериментами в Яндекс.Метрике.
Как рассчитать нужный трафик и время теста
Это самый часто пропускаемый шаг. «Запустим, посмотрим по ощущениям» — почти гарантированный способ прийти к ложному выводу.
Три входных параметра для расчёта
Чтобы рассчитать размер выборки, нужно задать три числа:
- Базовая конверсия. Сколько процентов посетителей сейчас оставляют заявку. Берётся из Метрики за последние 4–8 недель.
- Минимально значимый эффект. Какой прирост конверсии вам интересен? Если текущая конверсия 3%, а вы хотите обнаружить рост хотя бы до 3,6% (плюс 0,6 процентных пункта, или плюс 20% относительно), это и есть минимально значимый эффект. Чем меньше эффект хотите поймать, тем больше нужно трафика.
- Уровень доверия. Стандарт в A/B-тестировании: 95%. Это значит, что если разницы нет, вы всё равно в 5% случаев случайно увидите «значимый» результат. Инструменты обычно используют 95% по умолчанию.
Вводите эти три числа в онлайн-калькулятор. Бесплатные варианты: калькулятор выборки от Evan Miller (evanmiller.org/ab-testing/sample-size.html), встроенный в VWO или в Optimizely. Калькулятор ответит: «вам нужно N конверсий на каждый вариант».
Почему нельзя просто разделить N на дневной трафик
Предположим, калькулятор сказал: нужно 400 конверсий на вариант. У вас 20 конверсий в день, значит нужно 20 дней? Почти, но не совсем.
Трафик неоднороден: в понедельник приходят одни люди, в пятницу вечером другие. Интернет-магазин получает пик заказов в субботу. Услуговый бизнес чаще всего активен в среду и четверг, когда люди планируют покупки. Если тест работает только с вторника по пятницу, выходные выпали из выборки, и результат нерепрезентативен.
Правило: тест должен пройти минимум один полный цикл дней недели. Для большинства бизнесов это не меньше 1–2 полных недель, считая с понедельника по воскресенье. Даже если нужный объём конверсий набрался за 4 дня, не останавливайтесь раньше семи.
Типичные ошибки: как не обмануть себя
Остановить тест слишком рано
Самая распространённая ошибка. На третий день тест показывает «98% уверенности», и хочется зафиксировать победителя. Но математика A/B-теста построена на предположении, что вы смотрите на данные только один раз, в конце теста.
Если проверять результаты каждый день и останавливаться при первом «значимом» результате, реальный уровень ложных срабатываний будет намного выше заявленных 5%. Это явление называется проблемой множественных сравнений, или «подглядыванием». Гипотетически: если бы разницы между вариантами не было вообще, но вы проверяли результат каждый день в течение месяца, рано или поздно случайный пик дал бы «значимый» результат.
Решение простое: определяйте срок теста до запуска. Запишите: «тест работает с понедельника по следующее воскресенье, смотрим результат только тогда». Придерживайтесь этого плана.
Тестировать несколько элементов одновременно
«Давайте заодно поменяем и заголовок, и кнопку, и цвет фона» — звучит разумно, но разрушает возможность интерпретации. Если результат положительный, непонятно, что именно сработало. Если отрицательный, то же самое.
Тестирование нескольких переменных одновременно называется мультивариантным тестом. Это легитимный метод, но он требует в разы больше трафика, чем обычный A/B-тест. Для большинства сайтов с небольшим трафиком это недостижимо. Тестируйте по одному изменению.
Игнорировать внешние факторы
Во время теста случились крупные праздники, конкурент остановил рекламу, ваш менеджер по продажам заболел, поменялась ставка в Директе — всё это влияет на конверсию независимо от варианта. Если что-то значимое произошло в период теста, зафиксируйте это и примите в расчёт при интерпретации. В некоторых случаях тест лучше перезапустить.
Изменить что-то в середине теста
Нашли баг в варианте Б и поправили его? Тест испорчен: данные «до исправления» и «после» относятся к разным вещам. Начинайте заново. Это неприятно, но правильно.
Как читать результаты: статистическая значимость простыми словами
Тест завершился. Инструмент показывает: вариант Б конвертирует на 15% лучше с уровнем доверия 96%. Что это значит?
p-value и уровень доверия
p-value — вероятность увидеть такую разницу (или ещё большую) случайно, при условии, что разницы между вариантами нет. p = 0,04 значит: «если бы оба варианта были одинаковы, вероятность получить такой результат составит 4%».
Уровень доверия — это 1 − p-value, выраженное в процентах. Уровень доверия 96% при p = 0,04 — это одно и то же число в разных форматах. Большинство инструментов показывают уровень доверия, потому что его проще читать.
Стандартный порог для принятия решения: 95%. Результат с уровнем доверия выше 95% считается статистически значимым. При уровне ниже 95% результат «ещё не ясен», даже если по цифрам один вариант выглядит лучше.
Что можно вывести из значимого результата
- Наблюдаемое различие между вариантами маловероятно случайно.
- Можно внедрять победивший вариант в production.
- Наблюдаемый прирост является оценкой с погрешностью. В production реальный эффект может быть чуть меньше или чуть больше.
Что нельзя вывести
- Что победивший вариант будет лучше всегда: со временем аудитория меняется, меняется рекламный трафик, контекст. Победа в тесте — это вывод про конкретный период, а не навсегда.
- Что результат перенесётся на другие страницы или другие сегменты аудитории. Нужен отдельный тест.
Если результат незначимый
Незначимый результат не означает, что вариант Б такой же, как А. Он означает: «у нас недостаточно данных, чтобы сделать уверенный вывод». Два пути:
- Если вы ещё не достигли заранее рассчитанного объёма выборки — продолжайте. Тест просто не закончен.
- Если объём уже набран, а значимости нет — разница слишком маленькая, чтобы её обнаружить при вашем трафике. Либо разницы вообще нет, либо эффект меньше того, что вы задали как «минимально значимый». Принимайте следующую гипотезу, а эту фиксируйте как неподтверждённую.
Что делать при малом трафике: альтернативы классическому A/B
Если сайт получает меньше нескольких десятков конверсий в неделю, классический A/B-тест займёт месяцы. За это время сменится сезон, изменится рекламный трафик, и результаты потеряют актуальность.
Для таких ситуаций есть несколько подходов, которые дают полезные данные без большой выборки.
Качественный анализ: Вебвизор и записи сессий
Вебвизор в Яндекс.Метрике записывает реальные сессии: вы видите, куда кликали пользователи, до какой точки листали страницу, где зависали и где уходили. Просмотр 20–30 записей позволяет увидеть паттерны: «все уходят сразу после первого экрана», «никто не долистывает до кнопки», «люди кликают на элемент, который не является ссылкой».
Качественный анализ не скажет, на сколько процентов вырастет конверсия, если вы перенесёте кнопку вверх. Но он точно покажет проблемы, которые A/B-тест при малом трафике обнаруживал бы год. Как работать с Вебвизором и искать узкие места через сессионный анализ, разобрано в статье про анализ сессий в Яндекс.Метрике.
Юзабилити-тестирование и интервью
Попросите 5–7 человек из вашей целевой аудитории пройти по посадочной странице и объяснить вслух, что они думают. Сессию можно провести через Zoom с записью экрана. Пять таких сессий обнаруживают большинство серьёзных проблем с UX и текстом, причём без статистики и без большого трафика.
Типичные находки: «я не понял, что именно вы делаете», «я не вижу, куда нажать», «мне непонятно, сколько это стоит». Это прямые данные для переработки страницы без ожидания статистической значимости.
Тепловые карты и карты кликов
Показывают, где пользователи кликают и как далеко листают. Встроены в Яндекс.Метрику: раздел «Карта кликов» и «Карта скроллинга». Полезны для двух сценариев:
- Клики не туда: люди кликают на элемент, который не является ссылкой или кнопкой. Это сигнал, что они ожидают там действие.
- Кнопка за линией скролла: большинство пользователей не долистывает до CTA. Значит, нужно либо поднять кнопку, либо добавить ещё одну вверху.
Байесовские методы тестирования
Классический A/B-тест (частотный, или фреквентистский) требует зафиксировать размер выборки заранее. Байесовский подход позволяет обновлять оценку вероятности по мере накопления данных без завышения ложных срабатываний. Часть инструментов (VWO, некоторые другие) поддерживает байесовский режим как альтернативу. VWO реализует его через движок SmartStats — байесовский последовательный движок, который автоматически корректирует результаты на «подглядывание». Это осмысленный выбор для команд, которые хотят принимать решения быстрее, принимая на себя чуть более мягкие статистические гарантии.
Пошаговый план: как запустить первый тест
- Определите проблему через данные. Посмотрите карту скроллинга и Вебвизор. Найдите место, где посетители уходят или не кликают. Это исходный материал для гипотезы.
- Сформулируйте гипотезу. «Если мы переформулируем заголовок с описания услуги на проблему клиента, конверсия вырастет, потому что посетитель быстрее поймёт, для него это или нет». Гипотеза = изменение + ожидаемый эффект + объяснение.
- Рассчитайте нужный трафик через онлайн-калькулятор. Зафиксируйте, когда тест считается завершённым.
- Запустите тест в выбранном инструменте и дайте ему работать полные недели.
- Не смотрите результаты раньше времени. Занесите дату финального просмотра в календарь.
- Прочитайте результаты в назначенный день. Если значимость достигнута, внедряйте победителя. Если нет, фиксируйте гипотезу как «не подтверждена» и берите следующую.
- Ведите журнал тестов. Что тестировалось, когда, какой результат. Это защищает от повторных тестов одних и тех же гипотез и помогает видеть паттерны.
A/B-тест — не разовое действие, а практика. Компании с высокими конверсиями проводят тесты постоянно: один тест закончился, запущен следующий. Большинство гипотез не подтверждается, и это нормально. Каждый отрицательный результат — информация о том, чего ваша аудитория не хочет, а значит, ценный сигнал для следующей гипотезы.
