Аналитика

Три ошибки в понимании p-value, из-за которых принимают неверные решения

Аналитика · · 5 мин чтения

P-Value

В первой части мы разобрались, что p-value — это детектор случайности: он подсказывает, можно ли доверять цифрам эксперимента или вы просто поймали удачный расклад монетки. Штука полезная, но обманчиво простая. Вокруг неё выросло целых три мифа, на которых спотыкаются даже матёрые аналитики и продакты. Разберём каждый — с примерами, чтобы больше не попадаться.

Ошибка №1: думать, что p-value — это вероятность того, что эффекта нет

Самая частая и самая коварная ловушка. Человек видит p-value = 0,17 и говорит: «Ага, значит с вероятностью 17% версии одинаковые». Это неправда.

P-value отвечает на вопрос, поставленный ровно наоборот. Оно говорит не «какова вероятность, что эффекта нет», а «если эффекта нет — как часто выскакивала бы такая разница».

Чтобы почувствовать разницу, вот аналогия. Врач берёт тест на редкую болезнь. Вопрос «какова вероятность положительного теста, если человек здоров?» и вопрос «какова вероятность, что человек здоров, если тест положительный?» — это два совершенно разных вопроса с разными ответами. Их путают постоянно, и цена ошибки бывает огромной.

Пример из жизни. Вы прогнали тест новой формы подписки. P-value вышло 0,04 — значимо. Коллега радостно пишет в чат: «Вероятность, что форма не работает, всего 4%!». Звучит красиво, но это неверная фраза. Правильно так: «Если бы форма ничего не меняла, такой результат выскочил бы лишь в 4% случаев — поэтому мы склонны верить, что она всё-таки работает». Вывод похожий, но формулировка «вероятность 4%, что не работает» — математически неверна и может подвести вас в спорных случаях.

Запомните: p-value описывает данные при условии «эффекта нет», а не вероятность самого «эффекта нет».

Ошибка №2: думать, что маленькое p-value = большой и важный эффект

Вторая ловушка ломает интуицию бизнеса. Кажется логичным: чем меньше p-value, тем сильнее эффект. Ничего подобного.

P-value говорит только о том, что эффект скорее всего существует. А вот насколько он большой — плюс 6% или плюс 0,1% — оно не сообщает вообще. Это отдельный вопрос, и меряется он отдельно (размером эффекта и доверительным интервалом).

Тут вся соль в размере выборки. Чем больше пользователей, тем более крошечные различия можно поймать. А на очень большой выборке значимым станет вообще любой микроскопический эффект.

Пример из жизни. Крупный маркетплейс тестирует новый оттенок серого в шрифте описания товара. Прогоняют на 5 миллионах пользователей. Получают p-value = 0,001 — сверхзначимо! Только вот прирост конверсии — +0,02%. Статистически железобетонно, а бизнесу — ноль пользы: разработка, ревью и раскатка обойдутся дороже, чем принесёт этот «эффект». Значимость есть, смысла — нет.

Обратный пример. Маленький стартап тестирует новую посадочную страницу на 200 пользователях. Видит рост конверсии аж на 30%, но p-value = 0,2 — незначимо. Данных мало, поэтому даже приличный эффект не удаётся отличить от случайности. Здесь смысл есть, а доказательств — не хватает.

Мораль: всегда смотрите на две цифры сразу — и на p-value (есть ли эффект), и на размер эффекта (стоит ли он свеч).

Ошибка №3: думать, что большое p-value доказывает отсутствие эффекта

Третья ловушка — зеркальная. Получили p-value = 0,3 и делают вывод: «Всё, эффекта нет, идея не работает, закрываем». Тоже неверно.

Большое p-value не говорит «эффекта нет». Оно говорит куда скромнее: «доказательств не хватило». Может, эффекта и правда нет. А может, он есть, но вы собрали слишком мало данных, чтобы его разглядеть. Отличить эти два случая по одному лишь большому p-value нельзя.

Есть железное правило статистики: отсутствие доказательств — это не доказательство отсутствия.

Пример из жизни. Вернёмся к нашей кнопке «Купить» из первой части. Чек вырос на 6%, но p-value = 0,17 — незначимо. Ошибочный вывод: «Кнопка не работает, откатываем». Правильный вывод: «Пока не доказано. Возможно, эффект настоящий, но выборка маловата». Что делать дальше — не хоронить идею, а добрать данных: продлить тест или увеличить группы. Вполне может оказаться, что на 50 000 пользователей те же 6% дадут уже p-value = 0,01, и кнопка окажется реальной находкой.

Именно на этой ошибке компании хоронят рабочие гипотезы просто потому, что поторопились и остановили тест раньше времени.

Как не попасться на все три ловушки: чек-лист

Держите под рукой короткую памятку, когда смотрите на результаты теста:

  1. Не переворачивайте p-value. Оно про «как выглядели бы данные без эффекта», а не про «вероятность, что эффекта нет».
  2. Смотрите на размер эффекта, а не только на значимость. Значимо ≠ важно. Спросите себя: этот прирост вообще окупит внедрение?
  3. Незначимо ≠ доказано, что не работает. Проверьте, хватило ли выборки, прежде чем хоронить гипотезу.

Коротко: три мифа о p-value

P-value — полезный инструмент, но врёт тот, кто читает его так:

  • «Вероятность, что эффекта нет» — нет, это вероятность такой разницы при отсутствии эффекта.
  • «Маленькое p-value = сильный эффект» — нет, силу эффекта меряют отдельно, а на большой выборке значимой становится любая мелочь.
  • «Большое p-value = эффекта нет» — нет, это лишь значит, что данных не хватило.

Проще говоря: p-value подсказывает, доверять ли цифрам, но не думает за вас. Все решения — значим ли результат, важен ли он для бизнеса и не пора ли добрать данных — всё равно остаются на вашей стороне.

А о том, как заранее прикинуть, сколько пользователей нужно набрать, чтобы поймать эффект за хвост и не остановить тест раньше времени, — уже в другой раз.

Подобьранные вручную ссылки:

Комментарии

Пока никто не высказался. Будьте первым.