11 июня, 2025
Как устроены A/B-эксперименты в Директ Про и как оценивать их корректность
В октябре 2024 года в Директ Про появилась возможность проводить A/B-тесты прямо в интерфейсе. Инструмент «A/B-экспериментыβ» помогает тестировать маркетинговые гипотезы и определять наиболее эффективные настройки рекламных кампаний.
В этой статье разберём методологию, как разделяется аудитория для экспериментов и рассчитываются метрики, а также поделимся данными, которые подтверждают статистическую корректность работы инструмента.
A/B-тесты дают специалистам по контекстной рекламе возможность:
- Принимать решения на основе объективных данных и минимизировать влияние субъективных оценок.
- Оптимизировать рекламные расходы. Выявлять и масштабировать наиболее эффективные подходы, отключать неэффективные.
- Повышать ключевые показатели эффективности. Систематически улучшать CTR, CR, снижать CPA и т. д.
- Повышать достоверность выводов. Статистическая значимость результатов позволяет быть уверенными, что изменения, которые вносятся в кампанию, необходимы.
Как провести A/B-эксперимент в Директ Про: разбираем процесс по шагам
Эксперименты в интерфейсе Директ Про находятся в разделе «Библиотека» → «А/B-эксперименты».
Чтобы провести А/B-тестирование, нужно:
- Сформулировать гипотезу. Определить, какой параметр тестируете и какой ожидаете результат.
- Подготовить рекламные кампании: создать отдельные для контрольного и тестовых вариантов.
- Настроить эксперимент в интерфейсе:
- Создать эксперимент в разделе «Библиотека» → «A/B-эксперименты»
- Определить основную метрику для оценки, например количество конверсий, CTR, CPA
- Указать длительность эксперимента, счётчик Яндекс Метрики, целевые действия
- Выбрать контрольный и тестируемый вариант и процент распределения аудитории между ними
- Запустить эксперимент и собрать достаточно статистических данных.
- Проанализировать результаты по ключевым метрикам: показам, кликам, конверсиям, стоимости и т. д.
- Выбрать оптимальный вариант для масштабирования на 100% аудитории или остановить эксперимент.
Одно из важнейших условий достоверного A/B-теста — корректное распределение аудитории. Разберём, как это происходит в Директ Про.
Как распределяется аудитория
При проведении эксперимента в Директ Про аудитория случайным образом разделяется на непересекающиеся сегменты. Их количество и доля от аудитории зависят от настроек эксперимента, которые рекламодатель задаёт самостоятельно.
Таргетинги, указанные в настройках кампании, например география, ключевые фразы и другие, применяются до разделения на экспериментальные сегменты. В итоге в тесте участвует только целевая аудитория кампаний.
В какой экспериментальный сегмент попадёт пользователь, определяет технология Крипта:
- В рамках конкретного эксперимента для каждого пользователя на основе его анонимного профиля генерируется уникальное числовое значение. Оно будет различаться для одного и того же пользователя в разных экспериментах и обеспечивать их независимость.
- Числовое значение математически преобразуется взятием остатка от деления на константу, например 1 000 000. Каждому остатку соответствует контрольный или один из тестовых сегментов — пропорционально заданным долям аудитории.
- Пользователь попадает в сегмент, если его характеристики соответствуют таргетингам кампании, и соответствующий ему остаток попадает в диапазон, который закреплён за данным сегментом.
Благодаря такому механизму пользователи случайно распределяются между группами эксперимента и не пересекаются.
Как рассчитываются метрики и статистическая значимость
Метрики A/B-эксперимента — это основа, которая помогает принять решение, внедрять тестируемые изменения в рекламные кампании или нет.
В экспериментах в Яндекс Директе метрики рассчитываются по пользователям, попавшим в соответствующие выборки. Например, количество кликов в контрольной группе — это сумма кликов всех пользователей в ней. При оценке результатов необходимо понимать, насколько изменились метрики в тестовой группе относительно контрольной и являются ли эти различия следствием тестируемых изменений, а не случайностью.
Для этого используется такой подход:
- Формируются подгруппы пользователей. Каждая экспериментальная группа (контрольная и тестовая) делится на несколько меньших непересекающихся подгрупп.
- Пользователи распределяются по этим подгруппам на основе уникального числового значения, которое генерируется для каждого пользователя в эксперименте. Механизм аналогичен основному разделению на группы, но с использованием другого алгоритма или параметров, чтобы обеспечить независимость.
- Для каждой такой подгруппы рассчитываются необходимые метрики: клики, конверсии и т. д.
- Затем распределения этих метрик по подгруппам статистически сравниваются между контрольной и тестовой группами с помощью критерия Манна — Уитни. Этот метод позволяет оценить, насколько вероятно, что наблюдаемые различия между группами случайны. По результатам этого сравнения для каждой метрики рассчитывается показатель статистической значимости (p-value).
Результаты эксперимента, учитывающие p-value, отображаются во вкладке «Отчёт». В таблице на первом месте располагается основная метрика, далее — остальные. Каждая ячейка, которая соответствует тестовому варианту, содержит:
- Процентное изменение метрики относительно контрольной группы.
- Два значения метрики — фактическую величину и эту же величину, экстраполированную на 100% аудитории, чтобы сопоставлять данные было удобнее.
- Цветовой прокрас ячеек, который зависит от направления изменения метрики с продуктовой точки зрения и уровня статистической значимости (p-value):
- Ярко-зелёный или красный — положительное или отрицательное изменение, p-value < 0,05. Указывает на статистически значимый результат.
- Светло-зелёный или красный — положительное или отрицательное изменение, 0,05 ≤ p-value < 0,2. Это значит, что наблюдается тенденция, результат требует осторожной интерпретации и, возможно, большего объёма данных для подтверждения.
Как подтверждается равномерность распределения пользователей и корректность расчётов
Основная цель A/B-тестирования — подтверждение или опровержение гипотезы на основе метрик. Поэтому важно, чтобы расчёту метрик и статистической значимости можно было доверять.
Мы провели анализ на основе сета A/A-экспериментов, чтобы подтвердить надёжность методологии и проверить:
- Равномерность распределения пользователей по группам
- Корректность расчёта показателя статистической значимости (p-value)
- Отсутствие значимых различий в социально-демографических характеристиках пользователей между группами
В стандартных A/B-тестах, где сравниваются разные кампании, например с различающимися таргетингами, бюджетами или целями, наблюдаемые различия в результатах могут быть обусловлены как эффективностью тестируемых изменений, так и исходными настройками. Это затрудняет оценку работы самой системы. A/A-эксперименты, напротив, используют идентичные кампании для контрольной и тестовой групп. Это исключает влияние настроек и позволяет точнее понять, являются ли расхождения, например в равномерности разделения аудитории, следствием работы системы, а не эффектом от различных тестовых гипотез.
В анализе использовались 150 A/A-пар из 141 эксперимента за период с октября 2024 года по апрель 2025 года, удовлетворяющих условиям: идентичность кампаний, равенство долей выборок, общее число пользователей в паре > 200.
Основные выводы исследования
Пользователи распределяются между группами равномерно
Анализ 150 A/A-пар показал, что при увеличении объёма выборки процентная разница в количестве пользователей между тестовой и контрольной группой стремится к нулю. Хотя в небольших экспериментах расхождения могут быть заметнее, в более объёмных они становятся пренебрежимо малы.
Это значит, что ни одна из групп в эксперименте не получает преимущества или недостатка в размере аудитории. Если было задано разделение 50/50, система действительно стремится к этому. Поэтому наблюдаемые в A/B-тестах различия с высокой вероятностью будут обусловлены именно тестируемыми изменениями, а не случайным или системным преимуществом одной из групп в размере аудитории.
Статистические расчёты корректны: система точно определяет значимость различий
Во всех А/А-парах для каждой метрики (показы, клики, конверсии и другие) рассчитывался показатель статистической значимости (p-value) с использованием критерия Манна — Уитни. Затем были определены 80-процентные доверительные интервалы для доли экспериментов, в которых p-value ниже установленных порогов 0,05 и 0,2. Оказалось, что 0,05 и 0,2 только в 19% случаев не попали в найденные интервалы, что не превышает ожидаемого уровня в 20%. Такой результат показывает, что систематической ошибки в расчётах нет и оценка вероятности ложноположительных результатов корректна.
Это значит, когда результат A/B-теста подсвечен ярко-зелёным или ярко-красным, этой оценке можно доверять. Система не генерирует избыточное количество ложноположительных результатов и корректно оценивает вероятность случайных колебаний. Это минимизирует риск принятия неверных решений на основе случайных всплесков данных.
Состав аудитории в группах сбалансирован по ключевым характеристикам
На примере пола (мужчины, женщины) и возраста (до 34 лет, от 35 лет) проанализировали, насколько равномерно распределяются между группами пользователи с различными социально-демографическими характеристиками. Во всех А/А-парах для долей пользователей с этими характеристиками, а также для долей показов, кликов, конверсий и других метрик рассчитывался показатель статистической значимости.
Анализ показал, что в 88% случаев пороговые значения 0,05 и 0,2 попадают в 80- процентные доверительные интервалы для долей экспериментов, в которых p-value не превосходит установленных уровней статистической значимости. Это означает, что нет оснований считать, что система разбивает пользователей по социально-демографическому признаку некорректно или предвзято.
Это значит, что сравниваемые группы действительно сопоставимы. Если одна из тестовых кампаний показывает лучшие результаты, это не связано с тем, что в неё случайно попало непропорционально много пользователей из более конверсионного сегмента. Сравнивают группы, схожие не только по количеству, но и по внутреннему составу.
Результаты этих исследований подтверждают, что механизм A/B-тестирования в Директ Про обеспечивает статистически корректное разделение аудитории и достоверный расчёт метрик и их значимости.