Нормальное распределение простыми словами

Проверь себя · 1/3разбор после ответа
В каком случае использование коэффициента Пирсона r для измерения связи наиболее уместно?

Что такое нормальное распределение

Если на собеседовании по аналитике вас спрашивают «а ваши данные распределены нормально?», речь не о том, всё ли с ними в порядке. Это вопрос про конкретную форму, по которой числа группируются вокруг своего среднего. Нормальное распределение (его же называют гауссовым) — самый частый такой шаблон в природе и в данных, и именно поэтому половина классической статистики построена вокруг него.

Интуиция простая. Представьте, что вы измерили рост тысячи взрослых людей. Большинство окажется недалеко от среднего, скажем, 170–180 см. Людей заметно выше или заметно ниже будет всё меньше, чем дальше вы уходите от центра, и примерно поровну в обе стороны. Если нарисовать, сколько людей попадает в каждый диапазон роста, получится симметричная колоколообразная кривая: высокая горка посередине и два пологих хвоста по краям. Это и есть «колокол» нормального распределения.

Похожую форму дают очень разные величины: ошибки измерений, отклонения деталей на конвейере от эталонного размера, баллы IQ (их специально шкалируют под нормальное), результаты многих биологических замеров. Объединяет их одно: итоговое значение складывается из множества мелких независимых вкладов, и ни один из них не доминирует. Чуть ниже мы увидим, что за этим стоит центральная предельная теорема — главная причина, почему нормальное распределение встречается так часто.

Важно сразу зафиксировать обратное: далеко не всё в жизни нормально. Доходы, размер чека, время отклика сервера, выручка на пользователя — у всех этих величин длинный хвост вправо, и колокол к ним не подходит. Путаница здесь стоит аналитику неверных выводов, поэтому к проверке нормальности мы ещё вернёмся.

Среднее и стандартное отклонение

Нормальное распределение полностью задаётся всего двумя числами, и понимать их на интуитивном уровне важнее, чем помнить формулу плотности. Первое число — среднее (его обозначают греческой буквой μ, «мю»). Это центр колокола: точка, относительно которой кривая симметрична, и одновременно самое вероятное значение. Сдвиньте среднее — и весь колокол целиком переедет влево или вправо по оси, не меняя формы.

Второе число — стандартное отклонение (буква σ, «сигма»). Оно отвечает за ширину колокола, то есть за то, насколько сильно значения разбросаны вокруг среднего. Маленькая сигма — узкий и высокий пик, значения тесно жмутся к центру. Большая сигма — широкий и низкий колокол, разброс большой. Если среднее говорит «где центр», то стандартное отклонение говорит «насколько кучно».

У нормального распределения есть приятное следствие симметрии: среднее, медиана и мода совпадают в одной точке. Для скошенных данных это не так, и расхождение между средним и медианой — как раз один из быстрых признаков, что распределение не нормальное. Ещё одна теоретическая деталь: формально нормальное распределение не имеет границ и тянется от минус до плюс бесконечности. На практике хвосты убывают так быстро, что значения дальше трёх-четырёх сигм встречаются крайне редко.

Правило 68-95-99.7

Из двух параметров вытекает удобное эмпирическое правило, которое стоит знать наизусть. В любом нормальном распределении примерно 68% всех значений лежат в пределах одного стандартного отклонения от среднего, около 95% укладываются в две сигмы (если совсем точно — в 1,96σ), и почти всё, 99,7%, попадает в три сигмы. Его так и называют — правило трёх сигм, или правило 68-95-99.7.

Разберём на простом примере. Пусть средний чек в магазине равен 1000 ₽, а стандартное отклонение составляет 200 ₽ (и пусть для иллюстрации чеки распределены нормально). Тогда примерно две трети всех чеков попадут в диапазон от 800 до 1200 ₽, 95% чеков окажутся между 600 и 1400 ₽, а практически все — между 400 и 1600 ₽. Чек на 1800 ₽ отстоит от среднего на четыре сигмы; в нормальном распределении такое случается реже, чем раз на десять тысяч наблюдений, поэтому его разумно заподозрить как выброс.

Главная оговорка: правило работает только для нормального распределения. Если данные на самом деле скошены, рассуждение «это четыре сигмы, значит аномалия» легко даёт ложную тревогу. Для лог-нормальных величин вроде реального размера чека значение «в четырёх сигмах от среднего» может быть совершенно рядовым.

Стандартное нормальное распределение и z-оценка

Среди всех нормальных распределений выделяют одно особенное — стандартное нормальное: со средним 0 и стандартным отклонением 1. Его обозначают N(0, 1). Удобно оно тем, что любое нормальное распределение можно к нему привести, и тогда таблицы вероятностей и пороговые значения становятся универсальными.

Перевод делается через z-оценку (её же называют стандартизацией). Формула читается словами так: из значения вычитаем среднее и делим на стандартное отклонение.

z = (значение − среднее) / стандартное отклонение

Смысл z-оценки — «на сколько стандартных отклонений данное значение отстоит от среднего». z = 0 означает ровно среднее, z = 2 — два стандартных отклонения вправо, z = −1,5 — полтора отклонения влево. Это превращает несравнимые величины в общую шкалу: рост в сантиметрах и зарплату в рублях можно сопоставить, переведя оба в z-оценки. Заодно z-оценка лежит в основе поиска выбросов (часто аномалией считают |z| больше 3) и в основе доверительных интервалов, где знаменитое значение 1,96 — это z-оценка, отсекающая центральные 95% стандартного нормального распределения.

Как проверить нормальность

Прежде чем применять метод, который опирается на нормальность, полезно проверить само предположение. Начинать стоит с глаз, а не с тестов. Гистограмма сразу покажет грубую форму: видно ли симметричный колокол или есть перекос и длинный хвост в одну сторону. Ещё информативнее график квантиль-квантиль (Q-Q plot): он сопоставляет квантили ваших данных с квантилями идеального нормального распределения. Если точки ложатся близко к прямой линии — данные близки к нормальным; если на концах точки загибаются вверх или вниз — у распределения тяжёлые хвосты или скошенность.

import scipy.stats as stats
import matplotlib.pyplot as plt

stats.probplot(data, dist="norm", plot=plt)
plt.show()

Кроме визуальной оценки есть формальные тесты на нормальность. Тест Шапиро-Уилка хорошо подходит для небольших выборок и считается одним из самых мощных. Тест Колмогорова-Смирнова — классический способ сравнить эмпирическое распределение с теоретическим. Есть и более чувствительный тест Андерсона-Дарлинга, который сильнее реагирует на отклонения в хвостах. Все они проверяют гипотезу «данные нормальны»: маленькое p-value говорит, что от нормальности есть статистически значимое отклонение.

У формальных тестов есть важная ловушка. На больших выборках они почти всегда отвергают нормальность, потому что замечают даже крошечные, практически не важные отклонения. Поэтому опытные аналитики не молятся на p-value теста, а смотрят на картину целиком: что показывает Q-Q plot, насколько перекос велик по существу и устойчив ли выбранный метод к небольшим нарушениям нормальности. Разобрать такие задачи на конкретных примерах помогает тренажёр по статистике — там вопросы про распределения, проверку гипотез и A/B-тесты идут блоками с пояснениями.

Подготовься к собесу по A/B и статистике
300+ вопросов с разбором: дизайн, размер выборки, p-value, ловушки
Тренировать A/B в Telegram

Почему нормальное распределение важно в статистике

Может показаться странным: реальные данные часто не нормальны, а половина статистики всё равно построена на нормальном распределении. Разгадка — в центральной предельной теореме. Она говорит, что сумма (а значит, и среднее) большого числа независимых случайных величин стремится к нормальному распределению, какой бы ни была форма исходных данных. То есть даже если сами наблюдения скошены, выборочное среднее при достаточном объёме выборки ведёт себя примерно нормально.

Именно поэтому нормальность нужна не столько самим данным, сколько оценкам, которые мы из них считаем. Когда вы измеряете средний чек, конверсию или удержание, вас интересует не одно наблюдение, а среднее по выборке — а его распределение благодаря теореме близко к нормальному. На этом стоят доверительные интервалы: оценка плюс-минус z, умноженное на стандартную ошибку, где для 95% берут z = 1,96 ровно из стандартного нормального распределения.

Та же логика лежит под A/B-тестами. Классические t-тест и z-тест предполагают нормальность, и для непрерывных метрик при разумных объёмах это выполняется автоматически. Для долей вроде конверсии каждое наблюдение бинарно (купил или нет), но при больших выборках биномиальное распределение хорошо приближается нормальным, и тест снова работает. Наконец, на нормальность ошибок опираются многие модели машинного обучения — например, линейная регрессия, где остатки в идеале распределены нормально, а также методы вроде смесей гауссиан и метода главных компонент.

Что делать с ненормальными данными

Когда распределение явно скошено, есть несколько рабочих стратегий, и они дополняют друг друга. Первая — преобразовать данные: логарифмирование часто превращает скошенные вправо величины (чеки, время отклика, доход) во что-то близкое к нормальному, а более гибкое преобразование Бокса-Кокса подбирает степень автоматически. Вторая — сменить метод на непараметрический: вместо t-теста взять тест Манна-Уитни, который не требует предположения о нормальности и сравнивает распределения напрямую.

Третья и самая универсальная — bootstrap: вы многократно пересэмплируете свою выборку с возвращением и строите распределение интересующей статистики эмпирически, без всяких допущений о её форме. Это особенно удобно для сложных метрик и тяжёлых хвостов, где формулы из учебника не применимы. Выбор между подходами зависит от задачи, но общий принцип один: не насиловать данные нормальной моделью, если они в неё не укладываются.

Частые ошибки

Самая распространённая ошибка — считать нормальным всё подряд. Доход, выручка на пользователя, время на странице, размер заказа почти всегда скошены вправо, и применять к ним правило трёх сигм или t-тест без оглядки означает получать неверные выводы. Перед выбором метода стоит хотя бы посмотреть на гистограмму.

Вторая ошибка — слепо доверять формальному тесту на нормальность. На больших выборках он отвергнет нормальность практически всегда, потому что цепляется за микроскопические отклонения, которые на результат не влияют. Тест полезен, но решение принимают по совокупности: график, величина перекоса и устойчивость метода, а не по одному p-value.

Третья ошибка — применять правило 68-95-99.7 к ненормальным данным. Фраза «мой чек на 1800 — это четыре сигмы, аномалия» звучит убедительно, но если чеки лог-нормальны, такое значение совершенно рядовое, и тревога ложная. Сначала убедитесь в форме распределения, потом считайте сигмы.

Четвёртая ошибка — путать стандартное отклонение и стандартную ошибку. Стандартное отклонение (σ) описывает разброс самих данных и от объёма выборки не зависит. Стандартная ошибка — это σ, делённое на корень из числа наблюдений; она описывает разброс оценки среднего и уменьшается с ростом выборки. Подставив одно вместо другого, легко построить доверительный интервал в разы шире или уже нужного.

Связанные темы

FAQ

Что такое нормальное распределение простыми словами?

Это симметричная колоколообразная форма, по которой группируются числа: большинство значений около среднего, а чем дальше от центра, тем реже они встречаются, причём поровну в обе стороны. Полностью задаётся двумя параметрами — средним и стандартным отклонением.

Чем среднее отличается от стандартного отклонения?

Среднее определяет, где находится центр колокола, а стандартное отклонение — насколько широко значения разбросаны вокруг него. Сдвиг среднего двигает весь колокол по оси, а изменение стандартного отклонения делает его уже или шире.

Все ли данные распределены нормально?

Нет. Рост, IQ и ошибки измерений близки к нормальному, а доход, размер чека, время отклика и выручка на пользователя — нет: у них длинный хвост вправо. Поэтому нормальность всегда стоит проверять, а не предполагать по умолчанию.

Как быстро проверить нормальность?

Начните с гистограммы и графика квантиль-квантиль (Q-Q plot): если точки ложатся на прямую, распределение близко к нормальному. Для формальной проверки используют тесты Шапиро-Уилка, Колмогорова-Смирнова или Андерсона-Дарлинга, но на больших выборках их выводам нельзя доверять вслепую.

Зачем нормальное распределение нужно в A/B-тестах?

Классические t-тест и z-тест предполагают, что оцениваемая величина распределена нормально. Благодаря центральной предельной теореме выборочное среднее становится примерно нормальным даже на скошенных данных, поэтому тесты корректно работают при достаточном объёме выборки.

В чём разница между сигмой и стандартной ошибкой?

Стандартное отклонение (сигма) измеряет разброс самих данных и не зависит от размера выборки. Стандартная ошибка — это сигма, делённая на корень из числа наблюдений; она измеряет точность оценки среднего и уменьшается, когда выборка растёт.