Мода распределения
англ. Mode of a distribution
Точка максимума плотности (или наивероятнейшее значение у дискретной величины). Распределение может быть унимодальным, бимодальным и вовсе без моды, как у равномерного.
Мода — самое вероятное значение случайной величины: точка, где плотность достигает максимума; у дискретной величины — значение с наибольшей вероятностью. Это самая «демократичная» из характеристик центра: она отвечает на вопрос «что вероятнее всего увидишь», а не «что в среднем» или «что посередине массы». Для непрерывной величины моду ищут, приравняв производную плотности к нулю и проверив знак; для дискретной — просто смотрят в таблицу вероятностей. В биномиальной схеме наивероятнейшее число успехов считается по неравенству — см. схему Бернулли. Мода есть не у всех: у равномерного распределения плотность плоская, мода не выделена; зато распределений с несколькими модами (двугорбых) в природе много — размеры одежды, время пробок.
Примеры. Биномиальное с , : вероятности максимальны при — мода . Возьмём : неравенство даёт , единственная мода , . Непрерывный пример: плотность на возрастает, максимум на правом конце — мода на границе, хотя производная там не ноль; производная поймает только внутренние максимумы. Триада «мода — медиана — среднее» — быстрая рентгеновская снимка формы: в правоскошенном распределении мода левее медианы, а медиана левее среднего. Про медиану подробнее — в терминах медиана распределения, о среднем — в математическом ожидании.
Частые вопросы
Как найти моду выборки и что делать при нескольких модах?
Мода выборки — значение, встречающееся чаще всего; для сгруппированных данных — центр модального интервала с наибольшей частотой. Если два значения набрали одинаковую частоту, распределение бимодальное — и это полезный сигнал: два горба часто означают смесь двух однородных групп (два сегмента покупателей, два типа заявок), а не «плохие данные». Для бимодальных выборок среднее попадает в «долину» между горбами и описывает несуществующего типичного представителя. Правильная реакция — разбить данные на группы и описывать каждую своей модой, медианой и средним.
Может ли мода быть на границе распределения?
Да, и пример уже был: плотность на монотонно растёт, и максимум сидит на правом конце . У показательного распределения мода всегда в нуле — самый вероятный срок службы «сразу сломаться», хотя среднее равно . Формальный поиск через такие граничные моды пропустит: производная на границе не обязана обращаться в ноль. Поэтому алгоритм аккуратный: найти стационарные точки, сравнить в них значения плотности, затем проверить концы области определения — максимум может сидеть где угодно.