Z-тест для двух долей
Даёт p-value: вероятность увидеть такую же разницу, если варианты на самом деле одинаковы. Дисперсия объединённая — так тест не занижает погрешность на неравных группах.
z = (p₂ − p₁) / √(p̄(1 − p̄)(1/n₁ + 1/n₂))Значимость, деньги и планирование — в браузере, без регистрации.
Сколько ошибок первого рода вы готовы допустить. 95% — отраслевая договорённость, а не закон природы: для дешёвых обратимых изменений хватает 90%, для смены цен берут 99%.
Двусторонняя ловит и рост, и падение — честный вариант по умолчанию. Односторонняя даёт значимость быстрее, но только если вы заранее готовы игнорировать ухудшение.
При одном сравнении поправка ничего не меняет — она включается сама, как только вариантов становится больше двух.
Вероятность заметить эффект, если он есть. Задаёт расчётный объём выборки и срок теста, но не влияет на значимость уже собранных данных.
По умолчанию нужный объём считается под тот эффект, который уже виден в данных. Свой эффект — бизнес-решение: какой прирост вообще окупает внедрение. Он же подставится в режим планирования.
Необязательно. Если заполнить, остаток теста будет показан не только в посетителях, но и в днях.
Необязательно. Средняя маржа или доход с одной конверсии. Заполните — и калькулятор переведёт прирост и его нижнюю границу в деньги.
Никакой «магии значимости»: шесть классических методов, каждый выбран за то, что не разваливается на малых выборках и на нулевых конверсиях. Та же математика стоит в A/B-тестах платформы Sales Ninja.
Даёт p-value: вероятность увидеть такую же разницу, если варианты на самом деле одинаковы. Дисперсия объединённая — так тест не занижает погрешность на неравных группах.
z = (p₂ − p₁) / √(p̄(1 − p̄)(1/n₁ + 1/n₂))Даёт то, что от теста на самом деле хотят: вероятность, что вариант лучше контроля. Апостериорное распределение — Beta(1 + конверсии, 1 + отказы), вероятность считается точно, а не симуляцией.
P(p₂ > p₁) = Σ B(α₁+i, β₁+β₂) / ((β₂+i)·B(1+i, β₂)·B(α₁, β₁))Интервал доли — по Уилсону: он не вылезает за границы 0…100% и остаётся осмысленным даже при нуле конверсий. Интервал разности — гибридный метод Ньюкомба, собранный из двух интервалов Уилсона.
d ± √((p₂ − l₂)² + (u₁ − p₁)²)Сколько трафика нужно на вариант, чтобы эффект такого размера вообще стал различим — и обратная задача: какой минимальный эффект различим на уже собранном объёме.
n = (z_α + z_β)² · (p₁(1−p₁) + p₂(1−p₂)) / (p₂ − p₁)²Ожидаемые потери: на сколько в среднем упадёт конверсия, если внедрить лидера, а лучше окажется контроль. Это и есть честное правило остановки — куда практичнее, чем «дождались ли мы заветной звёздочки».
E[max(p₁ − p₂, 0)] = m₁·P(p₁' > p₂) − m₂·P(p₁ > p₂')Условная мощность на понятном горизонте: соберите ещё столько же данных — с какой вероятностью разница станет значимой, если нынешний тренд настоящий. Считать этот шанс «к расчётному объёму» бессмысленно: расчётный объём сам выведен из наблюдаемого эффекта, и ответ всегда равнялся бы заложенной мощности.
CP = Φ((Z / √t − z_α) / √(1 − t)), t = 0,5Эта страница отвечает на один вопрос: можно ли верить уже собранным числам. Всё остальное — поделить трафик, применить варианты на сайте, дождаться корректной остановки и показывать каждому посетителю то, что работает именно на нём, — делает Sales Ninja.
Данные вводите руками — и руками же собираете их из отчётов.
Один победитель для всей аудитории — это средняя температура по больнице. На мобильных, в регионах и во втором визите обычно выигрывают разные варианты, и настоящий прирост начинается там, где вместо одного победителя каждому сегменту показывают свой.
Познакомимся, разберём вашу ситуацию и наметим первые шаги. Без скриптов и давления: заявка вас ни к чему не обязывает.