Перейти к содержимому
Учи.Онлайн Выбрать школу
Статья

A/B-тестирование: что это, где применяется и как освоить

A/B-тестирование — способ проверить изменение на живых пользователях до того, как выкатить его всем. Посетителей случайно делят на две группы: одна видит текущую версию страницы, письма или экрана, другая — новую, а затем сравнивают заранее выбранную метрику. Самому придётся освоить четыре действия: сформулировать гипотезу с метрикой, рассчитать размер выборки и срок, дождаться этого срока и честно прочитать итог. Навык нужен маркетологу, продакт-менеджеру, дизайнеру и владельцу интернет-магазина. Ниже — учебный расчёт, типичные ошибки, способ сократить тест и выбор обучения.

Автор: редакция Учи.ОнлайнОтветственный редактор: Дмитрий Игнатьев
Содержание
Иллюстрация к статье: A/B-тестирование: что это, где применяется и как освоить

Частое заблуждение — считать A/B-тест кнопкой в сервисе: создал два варианта, подождал, посмотрел, где зелёная цифра. Сервис делит трафик и считает конверсию, но решающие шаги делаются до запуска. Если заранее не решить, какая разница важна и сколько людей нужно, чтобы её заметить, тест закончится случайным «победителем» или ничем. Профессии продуктового аналитика на сайте посвящена отдельная статья; здесь речь об экспериментах в вашей собственной работе.

Кому и для каких решений он нужен

Маркетолог сравнивает две темы письма или порог бесплатной доставки. Продакт-менеджер проверяет новое оформление заказа, прежде чем команда потратит квартал на доработку. Дизайнер приносит на обсуждение макета не вкус, а результат: форму с одним полем заполняют чаще, чем с тремя. Владелец магазина узнаёт, окупается ли скидка на первый заказ или дарит деньги тем, кто купил бы и так.

Подходит тест не всегда. При сотне посетителей в день небольшие улучшения он не заметит, и честнее поговорить с пятью покупателями. Он не годится для изменений, которые нельзя показать только половине людей, вроде нового логотипа. И он отвечает на вопрос «что лучше», но не «почему»; причину ищут интервью.

Из чего состоит тест

Начинают с гипотезы, записанной так, чтобы её можно было опровергнуть: «Если показать стоимость доставки прямо в карточке товара, доля визитов с заказом вырастет, потому что меньше людей бросят корзину, увидев неожиданную сумму». В ней есть изменение, метрика и механизм, а механизм подсказывает защитную метрику — показатель, который не должен ухудшиться. Здесь это средний чек: увидев доставку, люди могут класть в корзину меньше.

Затем определяют минимальный эффект, ради которого стоит внедрять изменение, и по нему считают размер выборки. Для доли, например конверсии, есть приближённая формула: n ≈ 16 × p × (1 − p) / Δ² человек в каждой группе, где p — текущая конверсия, Δ — разница, которую нужно уметь заметить. Она рассчитана на порог значимости 5 % и мощность 80 %: если эффект действительно есть, тест покажет его в четырёх случаях из пяти.

Длительность получается делением выборки на трафик и округляется до целых недель: покупатели в понедельник и в субботу ведут себя по-разному. Для сайта подойдёт, например, Varioqub от Яндекса: он делит посетителей по данным Метрики и позволяет менять тексты, стили и разметку.

Учебный пример: сколько ждать магазину

Ситуация вымышленная. Магазин товаров для дома получает 3 000 визитов в день, заказ оформляют в 2,5 % из них. Владелец проверяет гипотезу о доставке в карточке и внедрит её, если конверсия вырастет хотя бы на десятую часть, до 2,75 %.

Подставляем в формулу: 16 × 0,025 × 0,975 / 0,0025² ≈ 62 400 визитов в каждую группу, около 125 тысяч на весь тест. При 3 000 визитов в день это почти 42 дня — шесть недель. Если согласиться замечать только рост на пятую часть, до 3 %, разница Δ удвоится, а выборка уменьшится вчетверо: около 15 600 на группу, 31 200 всего, чуть больше десяти дней, а после округления — две недели.

Вывод неприятный, но полезный: небольшому магазину не стоит тестировать оттенок кнопки, эффект в пару процентов потребует полугода трафика. Разумнее проверять заметные изменения — условия доставки, шаги оформления — и заранее записать план: гипотезу, метрики, эффект, срок и правило решения.

Две ошибки, которые портят честный тест

Первая — подглядывание. Владелец открывает отчёт каждое утро и останавливает тест в день, когда разница стала «значимой». Беда в том, что p-значение в начале теста сильно скачет: при ежедневных проверках шанс хотя бы раз увидеть случайное «значимо» намного выше заявленных 5 %. Защита — дождаться рассчитанного срока. Если следить за результатом по ходу необходимо, используют последовательные методы, где порог пересчитан под постоянные проверки.

Вторая — множественные сравнения. Дизайнер запускает тест с контрольной версией и тремя новыми макетами и сравнивает каждый с контролем по порогу 5 %. Даже если ни один макет ничем не лучше, вероятность, что хотя бы один «победит», около 14 % (1 − 0,95³). Помогают заранее назначенная главная метрика и поправка Бонферрони: порог делят на число сравнений, 0,05 / 3 ≈ 0,017.

Как сократить срок без обмана

Шесть недель в примере — не приговор: срок зависит и от разброса метрики. На этом построен метод CUPED, который исследователи Microsoft Алекс Дэн, Я Сюй, Рон Кохави и Тоби Уокер описали в 2013 году на конференции WSDM (Deng, Xu, Kohavi, Walker, WSDM 2013). Различия между людьми во многом объясняются их поведением до теста: кто часто покупал раньше, покупает и сейчас. Если учесть в расчёте поведение каждого пользователя за одну-две недели до старта, шума становится меньше, а оценка разницы не искажается, потому что группы по-прежнему случайные.

По данным авторов, в поисковике Bing метод снижал разброс примерно наполовину — это та же чувствительность при вдвое меньшем числе пользователей или вдвое более коротком тесте. В трёх недавних на тот момент экспериментах снижение составило 45, 52 и 49 % при неделе теста и неделе данных до него. Показательный случай — эксперимент, где ответ Bing намеренно задерживали на 250 миллисекунд: обычный расчёт показал влияние на кликабельность на грани порога 0,05, а с CUPED разница была значимой с первого дня.

Для магазина важно ограничение, которое называют сами авторы: у новых пользователей истории нет. Метод сильнее помогает там, где много постоянных людей, — в приложении или подписке; если почти весь трафик — новички из рекламы, выигрыш меньше. Считать CUPED вручную не нужно, но полезно спросить аналитика или платформу, применяется ли он.

С чего начать и в каком порядке осваивать

Порядок ниже идёт от понимания к расчётам: без базовой статистики непонятно, что значит «значимо», без плана тест превращается в угадывание, а читать результат имеет смысл только у корректно проведённого теста.

  1. Разберитесь с долей, погрешностью, порогом значимости и мощностью; хватит школьной алгебры.
  2. Запишите гипотезы для своей работы по схеме «изменение — метрика — механизм» и к каждой добавьте защитную метрику.
  3. Рассчитайте выборку и срок для двух-трёх гипотез на реальном трафике и отсейте те, что займут больше двух месяцев.
  4. Проведите A/A-тест с двумя одинаковыми версиями, чтобы проверить разбиение.
  5. Запустите первый A/B-тест с записанным заранее планом и не смотрите на итог до назначенного дня.
  6. Напишите короткий отчёт: эффект с интервалом, защитные метрики, решение и то, чего по этим данным сказать нельзя.

Для владельца бизнеса или руководителя, которому эксперименты нужны в связке с финансами и маркетингом, подойдёт программа «Аналитика для директоров» от Eduson Academy: A/B-тесты там идут рядом с юнит-экономикой, маркетинговой аналитикой и Power BI, в базовом тарифе 15 модулей, 9 тренажёров и 28 кейсов. По обзору, сроки расходятся — четыре или шесть месяцев, — а итоговый проект не описан, это стоит уточнить у школы.

Упражнения и проверка себя

Первое упражнение — калькулятор своими руками. Сделайте в таблице расчёт по формуле из этой статьи: на входе конверсия, желаемый эффект и трафик, на выходе выборка и число недель. Сверьте результат с онлайн-калькулятором: двукратное расхождение — повод искать ошибку.

Второе — симуляция подглядывания. Сгенерируйте две группы с одинаковой конверсией 3 %, каждый «день» добавляйте по 500 визитов и проверяйте разницу. Повторите сотню раз и посчитайте, как часто хотя бы в один день выходило «значимо».

Если нужна длинная программа, где эксперименты входят в работу менеджера продукта целиком, посмотрите курс ProductStar «Профессия: Middle&Senior Product manager»: на нём есть модуль «A/B-тестирование и Unit-экономика» из 11 уроков с когортным анализом, домашние задания проверяют менторы, срок — 10–11,5 месяца. Рецензент замечает, что около 38 % уроков — базовые темы вроде SQL с нуля, хотя программа заявлена для middle и senior.

Как навык влияет на доход

Отдельной надбавки за A/B-тесты вакансии обычно не называют: навык стоит строкой в требованиях и меняет доход через задачи, которые вам доверяют. Маркетолог, доказавший эффект скидки экспериментом, получает право распоряжаться бюджетом.

Для ориентира есть узкие данные. Калькулятор зарплат Хабр Карьеры по навыку «A/B тестирование» при просмотре в конце сентября 2026 года показывал медиану 246 916 ₽ в месяц по 60 анкетам — вся Россия, все уровни вместе. По описанию методики это зарплаты и премии, которые пользователи указали сами за скользящие полгода, а не предложения работодателей. Выборка мала и состоит из IT-специалистов, отметивших навык в профиле, поэтому медиана описывает их зарплаты, а не цену одного умения.

Кто просит навык, видно по вакансиям Хабр Карьеры с навыком «A/B тестирование»: в те же дни их было девять, в основном менеджеры продукта, а также продуктовый дизайнер и бизнес-аналитик. Для своей профессии сравните вакансии с требованием A/B-тестов и без него в одном регионе и на одном уровне опыта.

Как выбрать обучение

Проверьте, есть ли расчёт выборки и срока на заданиях, а не только в лекции, и разбирают ли подглядывание, множественные сравнения и проверку разбиения. Если темы нет в опубликованном плане, спросите о ней школу напрямую.

Тем, кто уже работает аналитиком и хочет глубже заняться экспериментами, подойдёт курс Karpov.Courses «Продвинутая аналитика данных»: десять недель из двадцати трёх отведены продвинутым экспериментам с повышением чувствительности, CUPED-подобными методами и множественным тестированием, в модуле два кейс-теста и тринадцать мини-проектов. На вход нужны Python, SQL, дашборды и проверка гипотез, а нагрузку рецензент советует закладывать ближе к 16 часам в неделю.

Маркетологу, дизайнеру и владельцу магазина обычно хватает первых пяти шагов из порядка освоения. Перед оплатой обучения посчитайте срок для своей главной гипотезы: если выходит меньше месяца, начинайте с практики, если больше — ищите гипотезы крупнее.

Сравнить не отдельные программы, а сами онлайн-школы поможет рейтинг онлайн-школ с обучением продуктовой аналитике — отдельного рейтинга по A/B-тестированию на сайте нет, и эксперименты там входят в более широкую тему. Ни одна программа не гарантирует рост дохода; оценивайте её по тому, сможете ли вы после неё спланировать тест, который выдержит вопросы скептика.