Классический калькулятор A/Б-теста
Введите, сколько человек попало в каждый вариант и сколько из них сделали целевое действие. Калькулятор посчитает разницу и скажет, можно ли считать её настоящей — или это ещё похоже на случайность. Счёт здесь классический, частотный — тот самый, что даёт p-value.
Как это читать
p-value — вероятность увидеть такую разницу (или больше) при условии, что на самом деле варианты одинаковы. Маленькое значение говорит: случайностью это объяснить трудно. Оно не показывает ни вероятность того, что вы правы, ни размер выгоды.
График показывает, где правдоподобно лежит настоящая конверсия каждого варианта. Чем сильнее колокола налезают друг на друга, тем труднее отличить разницу от случайных колебаний. Пунктир — порог, за которым разница становится значимой; он посчитан по той же формуле, что и вердикт, поэтому «среднее B за пунктиром» и «разница значима» здесь всегда совпадают.
Двусторонняя гипотеза — вариант по умолчанию и почти всегда честный выбор: вы проверяете, что B отличается от A, не загадывая направление. Односторонняя даёт значимость легче, но только если направление выбрано до начала теста, а не после того, как вы увидели результат.
И главное, чего калькулятор за вас не сделает: размер выборки нужно определить до запуска и дождаться его. Если подглядывать в цифры каждый день и останавливать тест, как только загорелась значимость, ложные срабатывания станут обычным делом — сколько ни считай.