изображение

Акция Директа для селлеров: до 30 000 ₽ и другие бонусы

Для интернет-магазинов
Курсы
Про обучение

11 июня, 2025

Как устроены A/B-эксперименты в Директ Про и как оценивать их корректность

В октябре 2024 года в Директ Про появилась возможность проводить A/B-тесты прямо в интерфейсе. Инструмент «A/B-экспериментыβ» помогает тестировать маркетинговые гипотезы и определять наиболее эффективные настройки рекламных кампаний.

В этой статье разберём методологию, как разделяется аудитория для экспериментов и рассчитываются метрики, а также поделимся данными, которые подтверждают статистическую корректность работы инструмента.

A/B-эксперименты в Директ Про: как они устроены и как оценивать их корректность

A/B-тесты дают специалистам по контекстной рекламе возможность:

  • Принимать решения на основе объективных данных и минимизировать влияние субъективных оценок.
  • Оптимизировать рекламные расходы. Выявлять и масштабировать наиболее эффективные подходы, отключать неэффективные.
  • Повышать ключевые показатели эффективности. Систематически улучшать CTR, CR, снижать CPA и т. д.
  • Повышать достоверность выводов. Статистическая значимость результатов позволяет быть уверенными, что изменения, которые вносятся в кампанию, необходимы.

Как провести A/B-эксперимент в Директ Про: разбираем процесс по шагам

Эксперименты в интерфейсе Директ Про находятся в разделе «Библиотека» → «А/B-эксперименты».

Чтобы провести А/B-тестирование, нужно:

  1. Сформулировать гипотезу. Определить, какой параметр тестируете и какой ожидаете результат.
  2. Подготовить рекламные кампании: создать отдельные для контрольного и тестовых вариантов.
  3. Настроить эксперимент в интерфейсе:
    • Создать эксперимент в разделе «Библиотека» → «A/B-эксперименты»
    • Определить основную метрику для оценки, например количество конверсий, CTR, CPA
    • Указать длительность эксперимента, счётчик Яндекс Метрики, целевые действия
    • Выбрать контрольный и тестируемый вариант и процент распределения аудитории между ними
  4. Запустить эксперимент и собрать достаточно статистических данных.
  5. Проанализировать результаты по ключевым метрикам: показам, кликам, конверсиям, стоимости и т. д.
  6. Выбрать оптимальный вариант для масштабирования на 100% аудитории или остановить эксперимент.

Одно из важнейших условий достоверного A/B-теста — корректное распределение аудитории. Разберём, как это происходит в Директ Про.

Как распределяется аудитория

При проведении эксперимента в Директ Про аудитория случайным образом разделяется на непересекающиеся сегменты. Их количество и доля от аудитории зависят от настроек эксперимента, которые рекламодатель задаёт самостоятельно.

Таргетинги, указанные в настройках кампании, например география, ключевые фразы и другие, применяются до разделения на экспериментальные сегменты. В итоге в тесте участвует только целевая аудитория кампаний.

В какой экспериментальный сегмент попадёт пользователь, определяет технология Крипта:

  1. В рамках конкретного эксперимента для каждого пользователя на основе его анонимного профиля генерируется уникальное числовое значение. Оно будет различаться для одного и того же пользователя в разных экспериментах и обеспечивать их независимость.
  2. Числовое значение математически преобразуется взятием остатка от деления на константу, например 1 000 000. Каждому остатку соответствует контрольный или один из тестовых сегментов — пропорционально заданным долям аудитории.
  3. Пользователь попадает в сегмент, если его характеристики соответствуют таргетингам кампании, и соответствующий ему остаток попадает в диапазон, который закреплён за данным сегментом.

Благодаря такому механизму пользователи случайно распределяются между группами эксперимента и не пересекаются.

Как рассчитываются метрики и статистическая значимость

Метрики A/B-эксперимента — это основа, которая помогает принять решение, внедрять тестируемые изменения в рекламные кампании или нет.

В экспериментах в Яндекс Директе метрики рассчитываются по пользователям, попавшим в соответствующие выборки. Например, количество кликов в контрольной группе — это сумма кликов всех пользователей в ней. При оценке результатов необходимо понимать, насколько изменились метрики в тестовой группе относительно контрольной и являются ли эти различия следствием тестируемых изменений, а не случайностью.

Для этого используется такой подход:

  1. Формируются подгруппы пользователей. Каждая экспериментальная группа (контрольная и тестовая) делится на несколько меньших непересекающихся подгрупп.
  2. Пользователи распределяются по этим подгруппам на основе уникального числового значения, которое генерируется для каждого пользователя в эксперименте. Механизм аналогичен основному разделению на группы, но с использованием другого алгоритма или параметров, чтобы обеспечить независимость.
  3. Для каждой такой подгруппы рассчитываются необходимые метрики: клики, конверсии и т. д.
  4. Затем распределения этих метрик по подгруппам статистически сравниваются между контрольной и тестовой группами с помощью критерия Манна — Уитни. Этот метод позволяет оценить, насколько вероятно, что наблюдаемые различия между группами случайны. По результатам этого сравнения для каждой метрики рассчитывается показатель статистической значимости (p-value).

Результаты эксперимента, учитывающие p-value, отображаются во вкладке «Отчёт». В таблице на первом месте располагается основная метрика, далее — остальные. Каждая ячейка, которая соответствует тестовому варианту, содержит:

  • Процентное изменение метрики относительно контрольной группы.
  • Два значения метрики — фактическую величину и эту же величину, экстраполированную на 100% аудитории, чтобы сопоставлять данные было удобнее.
  • Цветовой прокрас ячеек, который зависит от направления изменения метрики с продуктовой точки зрения и уровня статистической значимости (p-value):
    • Ярко-зелёный или красный — положительное или отрицательное изменение, p-value < 0,05. Указывает на статистически значимый результат.
    • Светло-зелёный или красный — положительное или отрицательное изменение, 0,05 ≤ p-value < 0,2. Это значит, что наблюдается тенденция, результат требует осторожной интерпретации и, возможно, большего объёма данных для подтверждения.

Как подтверждается равномерность распределения пользователей и корректность расчётов

Основная цель A/B-тестирования — подтверждение или опровержение гипотезы на основе метрик. Поэтому важно, чтобы расчёту метрик и статистической значимости можно было доверять.

Мы провели анализ на основе сета A/A-экспериментов, чтобы подтвердить надёжность методологии и проверить:

  • Равномерность распределения пользователей по группам
  • Корректность расчёта показателя статистической значимости (p-value)
  • Отсутствие значимых различий в социально-демографических характеристиках пользователей между группами

В стандартных A/B-тестах, где сравниваются разные кампании, например с различающимися таргетингами, бюджетами или целями, наблюдаемые различия в результатах могут быть обусловлены как эффективностью тестируемых изменений, так и исходными настройками. Это затрудняет оценку работы самой системы. A/A-эксперименты, напротив, используют идентичные кампании для контрольной и тестовой групп. Это исключает влияние настроек и позволяет точнее понять, являются ли расхождения, например в равномерности разделения аудитории, следствием работы системы, а не эффектом от различных тестовых гипотез.

В анализе использовались 150 A/A-пар из 141 эксперимента за период с октября 2024 года по апрель 2025 года, удовлетворяющих условиям: идентичность кампаний, равенство долей выборок, общее число пользователей в паре > 200.

Основные выводы исследования

Пользователи распределяются между группами равномерно

Анализ 150 A/A-пар показал, что при увеличении объёма выборки процентная разница в количестве пользователей между тестовой и контрольной группой стремится к нулю. Хотя в небольших экспериментах расхождения могут быть заметнее, в более объёмных они становятся пренебрежимо малы.

Это значит, что ни одна из групп в эксперименте не получает преимущества или недостатка в размере аудитории. Если было задано разделение 50/50, система действительно стремится к этому. Поэтому наблюдаемые в A/B-тестах различия с высокой вероятностью будут обусловлены именно тестируемыми изменениями, а не случайным или системным преимуществом одной из групп в размере аудитории.

Статистические расчёты корректны: система точно определяет значимость различий

Во всех А/А-парах для каждой метрики (показы, клики, конверсии и другие) рассчитывался показатель статистической значимости (p-value) с использованием критерия Манна — Уитни. Затем были определены 80-процентные доверительные интервалы для доли экспериментов, в которых p-value ниже установленных порогов 0,05 и 0,2. Оказалось, что 0,05 и 0,2 только в 19% случаев не попали в найденные интервалы, что не превышает ожидаемого уровня в 20%. Такой результат показывает, что систематической ошибки в расчётах нет и оценка вероятности ложноположительных результатов корректна.

1/3

Это значит, когда результат A/B-теста подсвечен ярко-зелёным или ярко-красным, этой оценке можно доверять. Система не генерирует избыточное количество ложноположительных результатов и корректно оценивает вероятность случайных колебаний. Это минимизирует риск принятия неверных решений на основе случайных всплесков данных.

Состав аудитории в группах сбалансирован по ключевым характеристикам

На примере пола (мужчины, женщины) и возраста (до 34 лет, от 35 лет) проанализировали, насколько равномерно распределяются между группами пользователи с различными социально-демографическими характеристиками. Во всех А/А-парах для долей пользователей с этими характеристиками, а также для долей показов, кликов, конверсий и других метрик рассчитывался показатель статистической значимости.

Анализ показал, что в 88% случаев пороговые значения 0,05 и 0,2 попадают в 80- процентные доверительные интервалы для долей экспериментов, в которых p-value не превосходит установленных уровней статистической значимости. Это означает, что нет оснований считать, что система разбивает пользователей по социально-демографическому признаку некорректно или предвзято.

Это значит, что сравниваемые группы действительно сопоставимы. Если одна из тестовых кампаний показывает лучшие результаты, это не связано с тем, что в неё случайно попало непропорционально много пользователей из более конверсионного сегмента. Сравнивают группы, схожие не только по количеству, но и по внутреннему составу.

Результаты этих исследований подтверждают, что механизм A/B-тестирования в Директ Про обеспечивает статистически корректное разделение аудитории и достоверный расчёт метрик и их значимости.

Максим Белоусов

Максим Белоусов

Запустите продвижение в несколько кликов с Простым стартом

Директ быстро настроит кампанию
и поможет привлечь клиентов

Читайте также

Что такое A/B-тестирование и как правильно проводить сплит-тесты
Статьи

Содержание

SideBannerImage

Получите 5 000 ₽ на запуск продвижения

 Забрать бонус

Информационные услуги оказываются ООО «Яндекс» и не являются образовательными

Подпишитесь на новости

8 800 234-24-80

Звонок из регионов России бесплатный

© 2026 Яндекс