Калькулятор A/B‑теста

Значимость, деньги и планирование — в браузере, без регистрации.

Тест идёт или закончился — у вас есть цифры. Считаем статус, значимость и цену решения.

Данные теста

Конверсия5%
Конверсия6,15%
Расширенные настройки доверие 95% · поправка Бонферрони · мощность 80%
Уровень доверия

Сколько ошибок первого рода вы готовы допустить. 95% — отраслевая договорённость, а не закон природы: для дешёвых обратимых изменений хватает 90%, для смены цен берут 99%.

Гипотеза

Двусторонняя ловит и рост, и падение — честный вариант по умолчанию. Односторонняя даёт значимость быстрее, но только если вы заранее готовы игнорировать ухудшение.

Поправка на множественные сравнения

При одном сравнении поправка ничего не меняет — она включается сама, как только вариантов становится больше двух.

Мощность

Вероятность заметить эффект, если он есть. Задаёт расчётный объём выборки и срок теста, но не влияет на значимость уже собранных данных.

Минимальный интересный эффект

По умолчанию нужный объём считается под тот эффект, который уже виден в данных. Свой эффект — бизнес-решение: какой прирост вообще окупает внедрение. Он же подставится в режим планирования.

Трафик в сутки на весь тест

Необязательно. Если заполнить, остаток теста будет показан не только в посетителях, но и в днях.

Ценность конверсии

Необязательно. Средняя маржа или доход с одной конверсии. Заполните — и калькулятор переведёт прирост и его нижнюю границу в деньги.

Решениеможно ли внедрять прямо сейчас

p-value лидера 0,0043порог значимости 0,05
Прирост к контролю +23%интервал +6,68% … +41,9%
Разница в пунктах +1,15 п.п.интервал +0,361 п.п. … +1,94 п.п.
Цена ошибки: внедрить < 0,01 п.п.столько конверсии потеряете в среднем, если лидер окажется не лучше контроля

Продолжениеесть ли смысл тянуть дальше

Шанс на значимость, если удвоить выборку 99,8%разница уже значима — удваивать выборку незачем
Цена ожидания 1,15 п.п.столько конверсии теряете, пока держите контроль вместо лидера
Осталось тянуть 0%объём набран из 6 230 нужных на вариант
Различимый эффект сейчас +1,13 п.п.меньшую разницу набранный объём не поймает
Конверсия и доверительные интервалыТочка — измеренная величина, отрезок — где лежит истинная при доверии 95%. Серая полоса — интервал контроля: варианты, чьи отрезки из неё не выходят, от контроля неотличимы.
4,09%4,86%5,63%6,4%7,17%Контроль5%Вариант B6,15%
Где на самом деле лежит конверсия каждого вариантаАпостериорные распределения Beta(1 + конверсии, 1 + отказы). Чем уже колокол, тем больше данных. Пересечение колоколов — ровно та зона, в которой варианты ещё могут поменяться местами.
  • Контроль ±0,271%
  • Вариант B ±0,299%
4,09%4,86%5,63%6,4%7,17%
Прирост к контролю и его интервалОтрезок пересекает ноль — значит, вариант может оказаться и лучше, и хуже контроля: решение принимать рано.
0Вариант B+1,15 п.п.

Что делать дальше

  1. Внедряйте «Вариант B»Ожидаемая цена ошибки при внедрении — < 0,01 п.п., тогда как удержание контроля стоит 1,15 п.п.: тянуть дороже, чем внедрять.
  2. Планируйте по нижней границеОбещайте бизнесу +0,361 п.п., а не +1,15 п.п.: верхнюю границу интервала обычно не видят никогда.
  3. Проверьте срезыОдин победитель на всю аудиторию — средняя температура по больнице. На мобильных, в регионах и во втором визите обычно выигрывают разные варианты.

Как читать этот результат

  • p-value 0,0043 — это вероятность увидеть такую же или ещё большую разницу, если на самом деле варианты одинаковы. Это не вероятность того, что вариант лучше: её показывает соседняя метрика, 99,8%.
  • Интервал прироста +0,361 п.п. … +1,94 п.п. честнее одной цифры «+23%». Планируйте эффект по нижней границе: именно на неё стоит рассчитывать после внедрения.
  • Значимость проверяют один раз — на заранее выбранном объёме. Если смотреть на тест каждый день и останавливать его в первый же «зелёный», реальная вероятность ошибки в разы выше заявленной. От этого спасают последовательные методы вроде O’Brien-Fleming, а не более частые проверки.

Что считается под капотом

Никакой «магии значимости»: шесть классических методов, каждый выбран за то, что не разваливается на малых выборках и на нулевых конверсиях. Та же математика стоит в A/B-тестах платформы Sales Ninja.

Частотный

Z-тест для двух долей

Даёт p-value: вероятность увидеть такую же разницу, если варианты на самом деле одинаковы. Дисперсия объединённая — так тест не занижает погрешность на неравных группах.

z = (p₂ − p₁) / √(p̄(1 − p̄)(1/n₁ + 1/n₂))
Байесовский

Бета-биномиальная модель

Даёт то, что от теста на самом деле хотят: вероятность, что вариант лучше контроля. Апостериорное распределение — Beta(1 + конверсии, 1 + отказы), вероятность считается точно, а не симуляцией.

P(p₂ > p₁) = Σ B(α₁+i, β₁+β₂) / ((β₂+i)·B(1+i, β₂)·B(α₁, β₁))
Интервалы

Уилсон и Ньюкомб

Интервал доли — по Уилсону: он не вылезает за границы 0…100% и остаётся осмысленным даже при нуле конверсий. Интервал разности — гибридный метод Ньюкомба, собранный из двух интервалов Уилсона.

d ± √((p₂ − l₂)² + (u₁ − p₁)²)
Объём

Размер выборки и мощность

Сколько трафика нужно на вариант, чтобы эффект такого размера вообще стал различим — и обратная задача: какой минимальный эффект различим на уже собранном объёме.

n = (z_α + z_β)² · (p₁(1−p₁) + p₂(1−p₂)) / (p₂ − p₁)²
Потери

Цена ошибки

Ожидаемые потери: на сколько в среднем упадёт конверсия, если внедрить лидера, а лучше окажется контроль. Это и есть честное правило остановки — куда практичнее, чем «дождались ли мы заветной звёздочки».

E[max(p₁ − p₂, 0)] = m₁·P(p₁' > p₂) − m₂·P(p₁ > p₂')
Горизонт

Шанс на удвоении

Условная мощность на понятном горизонте: соберите ещё столько же данных — с какой вероятностью разница станет значимой, если нынешний тренд настоящий. Считать этот шанс «к расчётному объёму» бессмысленно: расчётный объём сам выведен из наблюдаемого эффекта, и ответ всегда равнялся бы заложенной мощности.

CP = Φ((Z / √t − z_α) / √(1 − t)), t = 0,5

Эвристики, которые экономят месяцы

Объём растёт как квадрат обратного эффектаЧтобы поймать вдвое меньшую разницу, нужно вчетверо больше данных. Поэтому усилить гипотезу почти всегда дешевле, чем добрать трафик.
Тест короче недельного цикла врётВ понедельник и в субботу покупают по-разному. Тест, не покрывающий целое число недель, измеряет день недели, а не ваше изменение.
Сначала эффект, потом статистикаЕсли гипотеза не тянет на прирост, который вы вообще способны различить своим трафиком, тест не нужен. Нужна другая гипотеза.
Эффект новизны таетПервые дни вариант может выигрывать просто потому, что он новый. Если отрыв уменьшается от недели к неделе — верьте последней неделе, а не всей выборке.
Значимость — не выгодаНа большом трафике значимым становится и прирост в сотую долю пункта. Спрашивайте не «значимо ли», а «окупает ли внедрение».
Пять изменений сразу — один ответЕсли вариант меняет всё сразу, вы узнаете только, что стало лучше, но не почему. Для решения этого хватает, для следующей гипотезы — нет.
Деньги шумнее конверсии — но не всегдаПри одинаковом относительном приросте тест на выручку требует больше трафика: к разбросу «купил / не купил» добавляется разброс самой суммы заказа. Но если вариант поднимает ещё и средний чек, денежный прирост оказывается крупнее конверсионного — и тест на деньги даёт ответ раньше.

Шесть ошибок, из-за которых A/B-тесты врут

  1. Остановка в первый «зелёный» день. Если проверять значимость каждый день и останавливать тест на первом успехе, реальная доля ложных побед уходит далеко за заявленные 5%. Объём выборки выбирают заранее — либо берут последовательные методы с распределением альфа-уровня.
  2. Несколько вариантов без поправки. Каждое дополнительное сравнение — ещё один шанс поймать случайность. Четыре варианта против контроля без поправки дают почти 19% вероятности объявить победителем шум вместо обещанных 5%.
  3. Решение по среднему, а не по интервалу. «+23% конверсии» звучит как факт, но если интервал прироста тянется от +1% до +48%, планировать надо по нижней границе. Верхнюю обычно не видят никогда.
  4. Тест на микроконверсии. Клики и переходы набираются быстро и дают значимость раньше, но выигранный клик не означает выигранную заявку и тем более выручку. Тест должен считать ту конверсию, ради которой существует бизнес.
  5. Победа по конверсии вместо победы по деньгам. Вариант может поднять долю покупателей и при этом просадить выручку: скидка приводит больше людей, но с меньшим чеком. Если решение про деньги — и считайте деньги: в калькуляторе для этого есть отдельный режим.
  6. Ботный трафик в выборке. Скрейперы и склики распределяются по вариантам неравномерно и умеют «выигрывать» тест целиком. Если сплит разъехался по размеру групп, калькулятор скажет об этом отдельной строкой.

Калькулятор проверяет тест. Платформа его проводит

Эта страница отвечает на один вопрос: можно ли верить уже собранным числам. Всё остальное — поделить трафик, применить варианты на сайте, дождаться корректной остановки и показывать каждому посетителю то, что работает именно на нём, — делает Sales Ninja.

Бесплатно, здесь и сейчас

Калькулятор

  • Значимость, интервалы и вероятность победы
  • Поправка на множественные сравнения
  • Сколько трафика ещё нужно набрать
  • Без регистрации, расчёт в браузере

Данные вводите руками — и руками же собираете их из отчётов.

Платформа Sales Ninja

A/B-тесты и персонализация

  • Многорукий бандит: трафик сам перетекает на лучший вариант, пока тест идёт
  • Четыре стратегии остановки, включая последовательный O’Brien-Fleming — без эффекта подглядывания
  • Тест на моделируемую конверсию, а не на клики: хватает даже нескольких десятков сделок в месяц
  • Боты вычитаются из выборки ML-фильтром до того, как испортят статистику
  • Метрика, Директ, VK Ads, Calltouch, UIS, Smartis, Rick.ai, amoCRM — в одном контуре
  • Дальше теста: персонализация сайта под сегмент, а не один победитель на всех

Один победитель для всей аудитории — это средняя температура по больнице. На мобильных, в регионах и во втором визите обычно выигрывают разные варианты, и настоящий прирост начинается там, где вместо одного победителя каждому сегменту показывают свой.

Расскажите о задаче.
Соберём решение
под ваш бизнес.

Познакомимся, разберём вашу ситуацию и наметим первые шаги. Без скриптов и давления: заявка вас ни к чему не обязывает.

  • Пишет живой менеджер, не бот
  • NDA по умолчанию,
    ничего не уйдёт наружу
  • Никаких почтовых цепочек и спама
Ответим в течение 1 рабочего дня
OTP BankDivan.ruМТС

Частые вопросы про значимость A/B-тестов