🔴 Сложный ⏱️ 60 минут

Оценка параметров

📋 Содержание урока

Оценка параметров 🎯

Ты обучил логистическую регрессию, минимизировал бинарную кросс-энтропию на тренировочных данных, получил веса модели — и внутри тебя, скорее всего, ни разу не мелькнуло слово «правдоподобие». А между тем ты только что решил задачу оценки параметров в её самой чистой форме: у тебя было семейство распределений (модель Бернулли с вероятностью $p$, зависящей от признаков через сигмоиду), было неизвестное значение параметров этой модели (веса $w$), и была выборка (размеченные примеры). Минимизация кросс-энтропии — это не отдельный, специально придуманный для нейросетей трюк. Это в точности метод максимального правдоподобия, надетый на другое имя.

В прошлом уроке ты разобрался, чем выборка отличается от генеральной совокупности и почему по конечному набору наблюдений вообще можно делать выводы обо всей совокупности. Но одно дело — сказать «выборочное среднее оценивает истинное среднее», и совсем другое — понять, что вообще значит слово «оценивает»: почему это среднее, а не медиана, не мода и не первое попавшееся наблюдение? Какими свойствами должна обладать хорошая оценка, чтобы ей можно было доверять? И, главное, есть ли общий рецепт, по которому для любого параметра любого распределения можно построить разумную оценку, не изобретая формулу каждый раз заново?

Такой рецепт есть, и это метод максимального правдоподобия (ММП, в англоязычной литературе — Maximum Likelihood Estimation, MLE). Идея у него обманчиво простая: выбери в качестве оценки параметра то значение, при котором уже увиденные тобой данные были бы наиболее вероятны. Из этого одного принципа выводится и формула для оценки вероятности успеха в схеме Бернулли, и формула для оценки среднего и дисперсии нормального распределения, и — что важнее всего для тебя как будущего специалиста по данным — сама структура функций потерь, на которых тренируется абсолютное большинство современных моделей машинного обучения. Функция потерь во многих задачах — это просто минус логарифм правдоподобия, переписанный так, чтобы его было удобно минимизировать градиентным спуском.

Сегодняшний урок закрывает три вопроса. Первый — чем точечная оценка отличается от интервальной и когда каждая из них нужна. Второй — какими тремя свойствами должна обладать «хорошая» оценка: несмещённостью, состоятельностью и эффективностью. Третий, самый важный, — как метод максимального правдоподобия строит оценки для произвольного распределения и почему он лежит в фундаменте обучения моделей.

🎯 Ты узнаешь:

  • Чем точечная оценка (одно число) отличается от интервальной оценки (доверительный интервал), и как построить простой доверительный интервал для среднего через нормальное приближение
  • Что такое несмещённость оценки — и почему это не то же самое, что «оценка обычно близка к истине»
  • Что такое состоятельность оценки и как она напрямую опирается на закон больших чисел из урока 242
  • Что такое эффективность оценки и почему из двух несмещённых оценок нужно выбирать ту, у которой меньше разброс
  • Как работает метод максимального правдоподобия: интуиция, строгое определение функции правдоподобия и полный вывод ММП-оценок для распределений Бернулли, нормального и Пуассона
  • Почему минимизация кросс-энтропии в логистической регрессии и минимизация суммы квадратов ошибок (MSE) в линейной регрессии — это два частных случая одного и того же принципа максимального правдоподобия

История: откуда это взялось?

Идея «подобрать параметр так, чтобы данные выглядели максимально правдоподобно» витала в воздухе задолго до того, как получила строгое имя. Ещё в начале XIX века Карл Фридрих Гаусс, выводя метод наименьших квадратов для обработки астрономических наблюдений, фактически показал: если считать, что ошибки измерений распределены по нормальному закону, то минимизация суммы квадратов отклонений даёт ровно то значение параметра, при котором вероятность (точнее, плотность вероятности) увидеть именно эти наблюдения максимальна. Гаусс не формулировал это как отдельный общий метод — для него это был побочный результат при обосновании метода наименьших квадратов, — но зерно идеи было посажено.

Общий принцип сформулировал и довёл до полноценной теории английский статистик и генетик Рональд Фишер. Уже в 1912 году, будучи студентом Кембриджа, двадцатидвухлетний Фишер написал заметку, где предложил использовать в качестве оценки параметра значение, максимизирующее то, что он тогда ещё называл «обратной вероятностью», критикуя при этом байесовский подход своего времени за произвольность априорных распределений. Термин «правдоподобие» (likelihood) как отдельное от «вероятности» понятие Фишер ввёл и чётко развёл только к 1921 году, а в своей программной статье 1922 года «On the Mathematical Foundations of Theoretical Statistics» он не просто дал общее определение метода максимального правдоподобия — он же ввёл и строго определил сами критерии качества оценки, о которых пойдёт речь в этом уроке: состоятельность (consistency), эффективность (efficiency) и достаточность (sufficiency, эта тема выходит за рамки курса). Фишер доказал, что при достаточно общих условиях ММП-оценки асимптотически (то есть при росте размера выборки) обладают наилучшими возможными свойствами — сходятся к истинному значению и делают это с минимально возможной дисперсией среди широкого класса оценок.

Фишер занимался этим не в башне из слоновой кости: годы с 1919-го он проработал статистиком на сельскохозяйственной опытной станции Ротамстед, разбирая десятилетия накопленных данных об урожайности при разных удобрениях и погодных условиях. Именно практическая нужда выжимать максимум информации из небольших, дорогих в получении наборов данных подтолкнула его к созданию не только метода максимального правдоподобия, но и дисперсионного анализа (ANOVA), и концепции $p$-значения. Забавная деталь: тот же человек, чьи методы сегодня составляют львиную долю классической статистики, при жизни спорил почти со всеми современниками — включая Карла Пирсона, о котором шла речь в прошлых уроках, — и многие из этих споров (например, о природе вероятности) не завершены в статистике по сей день. Но метод максимального правдоподобия пережил все споры и остался одним из двух-трёх самых универсальных инструментов построения оценок, дожив до эпохи глубокого обучения практически без изменений в своей сути.


Точечная оценка и интервальная оценка

Интуиция: число или диапазон?

Когда ты хочешь узнать неизвестный параметр генеральной совокупности — скажем, средний чек интернет-магазина, долю бракованных деталей на заводе, вероятность клика по баннеру, — у тебя ровно два способа ответить. Первый способ: назвать одно конкретное число, лучшее предположение, полученное из выборки. «Средний чек — 540 рублей». Это точечная оценка: единственное значение, приближающее неизвестный параметр.

Второй способ честнее: назвать не одно число, а диапазон значений, в котором истинный параметр находится с заданной степенью уверенности. «Средний чек лежит между 480 и 600 рублями с вероятностью 95%». Это интервальная оценка, и её ключевой инструмент — доверительный интервал.

Разница между этими двумя подходами — это разница между прогнозом погоды «завтра +18 градусов» и прогнозом «завтра от +15 до +21 градуса с вероятностью 90%». Первое число выглядит увереннее, но оно скрывает неопределённость, которая всё равно присутствует — просто её не показали. Второй вариант честно признаёт: мы не знаем истинное значение абсолютно точно, зато знаем, насколько именно мы не уверены. Чем больше выборка, тем точнее точечная оценка и тем уже доверительный интервал при том же уровне доверия — это прямое следствие закона больших чисел, с которым ты уже знаком по уроку 242.

Определение: Точечная оценка $\hat\theta$ параметра $\theta$ — это число, вычисленное по выборке $X_1, \dots, X_n$ и служащее приближением неизвестного истинного значения параметра. Формально точечная оценка — это функция от выборки, $\hat\theta = \hat\theta(X_1,\dots,X_n)$, и поскольку выборка случайна, сама оценка $\hat\theta$ — тоже случайная величина.

Интервальная оценка (доверительный интервал) уровня доверия $1-\alpha$ — это случайный интервал $(\hat\theta_{\text{ниж}},\ \hat\theta_{\text{верх}})$, построенный по выборке так, что вероятность накрыть истинное значение параметра $\theta$ равна $1-\alpha$:

$$P\big(\hat\theta_{\text{ниж}} \le \theta \le \hat\theta_{\text{верх}}\big) = 1-\alpha.$$

Для среднего нормально распределённой (или приближённо нормальной, по ЦПТ) величины при известной дисперсии $\sigma^2$ доверительный интервал строится по формуле

$$\hat\mu \pm z_{1-\alpha/2}\cdot\frac{\sigma}{\sqrt n},$$

где $z_{1-\alpha/2}$ — квантиль стандартного нормального распределения (для уровня доверия $95\%$ это $z=1{,}96$).

Обрати внимание на тонкость в формулировке: правильная интерпретация доверительного интервала звучит не «истинный параметр с вероятностью 95% лежит в этом конкретном интервале» (параметр не случаен — он фиксирован, просто неизвестен нам), а «если повторить процедуру построения интервала много раз на разных выборках, то примерно 95% построенных интервалов накроют истинное значение». Случаен здесь интервал, а не параметр.

Примеры с разбором

Пример 1 (лёгкий). Интернет-магазин хочет узнать средний чек покупки. Взята выборка из пяти случайных чеков: 450, 600, 380, 720 и 550 рублей. Найди точечную оценку среднего чека.

Точечная оценка среднего — это выборочное среднее:

$$\hat\mu = \frac{450+600+380+720+550}{5} = \frac{2700}{5} = 540.$$

Ответ: точечная оценка среднего чека равна 540 рублям. Это одно число — оно ничего не говорит о том, насколько сильно оно может отличаться от истинного среднего чека по всей клиентской базе.

Пример 2 (средний). Тот же магазин собрал уже 225 чеков, выборочное среднее оказалось $\hat\mu = 540$ рублей, а стандартное отклонение генеральной совокупности известно из предыдущих исследований и равно $\sigma = 15$ рублей. Построй 95%-й доверительный интервал для истинного среднего чека.

По формуле доверительного интервала с $z_{0{,}975} = 1{,}96$:

$$\text{погрешность} = z\cdot\frac{\sigma}{\sqrt n} = 1{,}96 \cdot \frac{15}{\sqrt{225}} = 1{,}96\cdot\frac{15}{15} = 1{,}96.$$

Доверительный интервал: $(540 - 1{,}96;\ 540+1{,}96) = (538{,}04;\ 541{,}96)$.

Ответ: с 95%-й уверенностью истинный средний чек лежит между $538{,}04$ и $541{,}96$ рублями. Обрати внимание, насколько интервал уже, чем в примере 1: при $n=225$ (а не $5$) погрешность падает пропорционально $1/\sqrt n$.

Пример 3 (сложный). Компания провела A/B-тест новой кнопки оформления заказа: из 1000 показов было зафиксировано 45 кликов. Точечная оценка конверсии — $\hat p = 45/1000 = 0{,}045$. Построй 95%-й доверительный интервал для истинной конверсии, используя нормальное приближение для доли: погрешность считается как $z\cdot\sqrt{\hat p(1-\hat p)/n}$.

Сначала считаем дисперсию под корнем:

$$\hat p(1-\hat p) = 0{,}045\cdot0{,}955 = 0{,}042975.$$

Делим на объём выборки и извлекаем корень:

$$\sqrt{\frac{0{,}042975}{1000}} = \sqrt{0{,}000042975} \approx 0{,}006556.$$

Умножаем на квантиль $z=1{,}96$:

$$\text{погрешность} = 1{,}96\cdot0{,}006556 \approx 0{,}01285.$$

Доверительный интервал: $(0{,}045-0{,}01285;\ 0{,}045+0{,}01285) = (0{,}0322;\ 0{,}0579)$, то есть примерно от $3{,}22\%$ до $5{,}79\%$.

Ответ: истинная конверсия лежит между $3{,}2\%$ и $5{,}8\%$ с уверенностью $95\%$. Заметь, насколько широк этот интервал при, казалось бы, приличной выборке в тысячу показов — именно поэтому в реальных A/B-тестах для уверенного вывода часто нужны десятки и сотни тысяч наблюдений, особенно когда базовая конверсия мала.

Почему это важно. В прикладной работе с данными точечная оценка без интервальной — это половина ответа. Когда дата-сайентист говорит «модель показала accuracy 87%» без указания доверительного интервала, руководитель не может понять, значимо ли это отличие от прошлой модели с accuracy 86%, или же это просто шум выборки. Интервальные оценки — это язык, на котором честно обсуждаются результаты A/B-тестов, метрики моделей и любые числа, посчитанные по конечной выборке, а не по всей генеральной совокупности.


Свойства хороших оценок: несмещённость, состоятельность, эффективность

Интуиция: три способа быть «хорошей» оценкой

Представь стрелка в тире, который целится в яблочко мишени. У его результатов может быть три независимых друг от друга свойства. Во-первых, центрированы ли его выстрелы вокруг яблочка в среднем, даже если каждый отдельный выстрел не попадает точно в центр? Если да — это аналог несмещённости. Во-вторых, становится ли его стрельба точнее, если дать ему больше патронов и позволить целиться дольше (или, для нашей аналогии с выборкой, — если увеличивать размер выборки, по которой строится оценка)? Это аналог состоятельности. В-третьих, если сравнить двух одинаково несмещённых стрелков, у кого кучность выше — чей разброс попаданий вокруг центра меньше? Это аналог эффективности.

Важно, что это три разных, независимых друг от друга свойства. Оценка может быть несмещённой, но при этом ужасно неэффективной (кучность низкая, хотя центр правильный). Оценка может быть смещённой, но состоятельной (смещение исчезает при росте выборки). А бывают патологические оценки, которые несмещены, но никогда не становятся точнее, сколько бы данных им ни давали, — то есть несостоятельны. Хорошая оценка в идеале обладает всеми тремя свойствами сразу, но на практике часто приходится выбирать компромисс — например, между несмещённостью и эффективностью (это явление в статистике и машинном обучении называют bias-variance trade-off, и ты ещё не раз встретишь его в курсе).

Определение: Пусть $\hat\theta = \hat\theta(X_1,\dots,X_n)$ — оценка параметра $\theta$, построенная по выборке объёма $n$.

Оценка называется несмещённой (unbiased), если её математическое ожидание по всем возможным выборкам равно истинному значению параметра при любом $n$:

$$\mathbb{E}[\hat\theta] = \theta.$$

Величину $\text{bias}(\hat\theta) = \mathbb{E}[\hat\theta] - \theta$ называют смещением оценки; для несмещённой оценки смещение равно нулю.

Оценка называется состоятельной (consistent), если при росте объёма выборки она сходится по вероятности к истинному значению параметра:

$$\hat\theta_n \xrightarrow{P} \theta \quad \text{при } n \to \infty,$$

то есть для любого сколь угодно малого $\varepsilon>0$ вероятность отклонения оценки от истинного значения больше чем на $\varepsilon$ стремится к нулю: $P(|\hat\theta_n - \theta| > \varepsilon) \to 0$. Это в точности та же идея сходимости по вероятности, что фигурирует в законе больших чисел (урок 242) — и, действительно, для выборочного среднего состоятельность следует напрямую из ЗБЧ.

Оценка называется эффективной в некотором классе оценок (обычно — в классе всех несмещённых оценок), если среди всех оценок этого класса она обладает наименьшей дисперсией:

$$\text{Var}(\hat\theta_{\text{эфф}}) \le \text{Var}(\hat\theta) \quad \text{для любой другой несмещённой оценки } \hat\theta.$$

Примеры с разбором

Пример 1 (лёгкий). Докажи, что выборочное среднее $\hat\mu = \frac1n\sum_{i=1}^n X_i$ — несмещённая оценка математического ожидания $\mu$ генеральной совокупности.

Используем линейность математического ожидания:

$$\mathbb{E}[\hat\mu] = \mathbb{E}\left[\frac1n\sum_{i=1}^n X_i\right] = \frac1n\sum_{i=1}^n \mathbb{E}[X_i] = \frac1n\sum_{i=1}^n \mu = \frac1n\cdot n\mu = \mu.$$

Ответ: $\mathbb{E}[\hat\mu] = \mu$, смещение равно нулю — выборочное среднее несмещённо оценивает истинное среднее генеральной совокупности при любом объёме выборки $n$, а не только асимптотически.

Пример 2 (средний). Проверим на несмещённость «наивную» оценку дисперсии $S_n^2 = \frac1n\sum_{i=1}^n(X_i-\hat\mu)^2$, где $\hat\mu$ — то же выборочное среднее. Найдём $\mathbb{E}[S_n^2]$ и посмотрим, совпадает ли оно с истинной дисперсией $\sigma^2$.

Разложим сумму квадратов отклонений от выборочного среднего через сумму квадратов отклонений от истинного $\mu$, добавив и вычтя $\mu$:

$$\sum_{i=1}^n (X_i-\hat\mu)^2 = \sum_{i=1}^n (X_i-\mu)^2 - n(\hat\mu-\mu)^2.$$

Это стандартное алгебраическое тождество (его можно проверить прямым раскрытием скобок). Возьмём математическое ожидание обеих частей. Для первого слагаемого, поскольку $\mathbb{E}[(X_i-\mu)^2] = \text{Var}(X_i) = \sigma^2$ для каждого из $n$ слагаемых:

$$\mathbb{E}\left[\sum_{i=1}^n (X_i-\mu)^2\right] = n\sigma^2.$$

Для второго слагаемого используем, что $\hat\mu$ — тоже случайная величина с дисперсией $\text{Var}(\hat\mu) = \sigma^2/n$ (это стандартный факт для среднего $n$ независимых величин), а значит $\mathbb{E}[(\hat\mu-\mu)^2] = \text{Var}(\hat\mu) = \sigma^2/n$:

$$\mathbb{E}\left[n(\hat\mu-\mu)^2\right] = n\cdot\frac{\sigma^2}{n} = \sigma^2.$$

Собираем вместе:

$$\mathbb{E}\left[\sum_{i=1}^n (X_i-\hat\mu)^2\right] = n\sigma^2 - \sigma^2 = (n-1)\sigma^2.$$

Значит:

$$\mathbb{E}[S_n^2] = \mathbb{E}\left[\frac1n\sum_{i=1}^n(X_i-\hat\mu)^2\right] = \frac{(n-1)\sigma^2}{n} = \frac{n-1}{n}\sigma^2 \ne \sigma^2.$$

Ответ: $S_n^2$ — смещённая оценка, она систематически занижает истинную дисперсию в $\frac{n-1}{n}$ раз. Чтобы устранить смещение, нужно делить не на $n$, а на $n-1$: исправленная оценка $S^2 = \frac{1}{n-1}\sum_{i=1}^n(X_i-\hat\mu)^2$ уже несмещена, $\mathbb{E}[S^2]=\sigma^2$. Именно поэтому в numpy и большинстве статистических пакетов есть параметр ddof (delta degrees of freedom), позволяющий переключаться между делением на $n$ и на $n-1$.

Пример 3 (сложный). Рассмотрим намеренно «плохую», но поучительную оценку: в качестве оценки среднего генеральной совокупности возьмём не выборочное среднее, а просто первое наблюдение выборки, $\hat\mu_{\text{перв}} = X_1$. Покажи, что эта оценка несмещённа, но не состоятельна, и сравни её дисперсию с дисперсией обычного выборочного среднего при $n=25$ для распределения с $\sigma^2=25$.

Шаг 1 (несмещённость). По определению математического ожидания одного наблюдения из выборки: $\mathbb{E}[X_1] = \mu$ — это верно при любом $n$, ведь $X_1$ — это просто одна случайная величина с тем же распределением, что и генеральная совокупность. Значит, $\hat\mu_{\text{перв}}$ несмещена, в точности как и $\hat\mu$.

Шаг 2 (состоятельность — точнее, её отсутствие). Дисперсия этой оценки не зависит от объёма выборки:

$$\text{Var}(\hat\mu_{\text{перв}}) = \text{Var}(X_1) = \sigma^2 = 25 \quad \text{при любом } n.$$

Сколько бы дополнительных наблюдений ты ни собрал, оценка $\hat\mu_{\text{перв}}$ продолжает игнорировать их все, кроме первого, — её точность не растёт. Это прямое нарушение состоятельности: $\hat\mu_{\text{перв}}$ не сходится по вероятности к $\mu$ при $n\to\infty$, потому что её дисперсия не стремится к нулю.

Шаг 3 (сравнение с обычным выборочным средним). Для сравнения при $n=25$:

$$\text{Var}(\hat\mu) = \frac{\sigma^2}{n} = \frac{25}{25} = 1.$$

Ответ: обе оценки несмещены, но $\text{Var}(\hat\mu_{\text{перв}})=25$ и не убывает с ростом $n$, а $\text{Var}(\hat\mu)=1$ при $n=25$ и продолжает убывать дальше. Оценка «взять первое наблюдение» — несмещённая, но несостоятельная и крайне неэффективная (в 25 раз больше дисперсии уже при таком скромном $n$). Этот пример показывает: несмещённость сама по себе — слабое требование, которое не гарантирует, что оценка вообще «использует» данные разумно.

Пример 4 (сложный, про эффективность). Известный асимптотический факт: для выборки из нормального распределения $N(\mu,\sigma^2)$ дисперсия выборочной медианы при больших $n$ приближённо равна $\text{Var}(\text{медиана}) \approx \dfrac{\pi}{2}\cdot\dfrac{\sigma^2}{n} \approx 1{,}5708\cdot\dfrac{\sigma^2}{n}$, тогда как дисперсия выборочного среднего равна ровно $\dfrac{\sigma^2}{n}$. Обе оценки несмещённы (и среднее, и медиана нормального распределения равны $\mu$). Сравни их эффективность.

Относительная эффективность среднего по отношению к медиане — это отношение дисперсий:

$$\frac{\text{Var}(\text{медиана})}{\text{Var}(\hat\mu)} = \frac{1{,}5708\,\sigma^2/n}{\sigma^2/n} = 1{,}5708.$$

Ответ: дисперсия медианы примерно в $1{,}57$ раза больше дисперсии среднего — значит, для нормально распределённых данных выборочное среднее эффективнее медианы: чтобы медиана дала такую же точность, какую даёт среднее на выборке размера $n$, медиане нужно примерно в $1{,}57$ раза больше наблюдений. Это не значит, что медиана — плохая оценка вообще: для распределений с тяжёлыми хвостами или выбросами (например, доходов населения) картина меняется на противоположную, и там уже медиана часто предпочтительнее из-за устойчивости к выбросам, даже ценой некоторой потери эффективности на «чистых» данных.

Почему это важно. В машинном обучении bias-variance trade-off — это ровно эта тройка свойств, перенесённая с оценки параметра на оценку функции (модели). Слишком простая модель (например, линейная регрессия на сильно нелинейных данных) систематически смещена — она в среднем ошибается в одну сторону. Слишком сложная модель (глубокая нейросеть на малом датасете) может быть почти несмещённой, но иметь огромную дисперсию — её предсказания сильно скачут от одного обучающего набора к другому. Правильный выбор сложности модели — это в точности поиск баланса между смещением и дисперсией, только вместо оценки одного числа $\theta$ оценивается целая функция.


Метод максимального правдоподобия

Интуиция: какой параметр сделал бы твои данные наиболее вероятными?

До сих пор мы обсуждали свойства уже готовых оценок — но откуда их вообще брать? Для среднего интуитивно понятно, что нужно использовать выборочное среднее. А если тебе нужно оценить параметр показательного распределения, или параметр Пуассона, или вероятность в распределении Бернулли, или веса логистической регрессии — формулу для каждого случая придумывать заново?

Метод максимального правдоподобия даёт единый рецепт, который работает для любого параметрического семейства распределений. Идея звучит так: у тебя есть выборка $x_1, \dots, x_n$ — уже случившиеся, зафиксированные числа. Есть семейство распределений с неизвестным параметром $\theta$. Задай вопрос по-другому, чем обычно задаётся в теории вероятностей: не «какова вероятность получить такие данные, если параметр равен конкретному значению», а «при каком значении параметра $\theta$ уже полученные данные были бы наиболее вероятны?». Тот $\theta$, который максимизирует эту «вероятность данных», и называется оценкой максимального правдоподобия.

Представь детектива, который нашёл на месте преступления определённые улики. Он не спрашивает «какова вероятность этих улик при случайном подозреваемом», он перебирает подозреваемых и выбирает того, для кого версия «это сделал он» делает найденные улики наиболее правдоподобными. Метод максимального правдоподобия работает точно так же: данные фиксированы, параметр — это «подозреваемый», а правдоподобие — это то, насколько хорошо конкретное значение параметра объясняет уже наблюдаемые данные.

Определение: Пусть $X_1, \dots, X_n$ — независимая выборка из распределения с плотностью (или вероятностной функцией, для дискретного случая) $f(x;\theta)$, зависящей от неизвестного параметра $\theta$. Функцией правдоподобия называется совместная плотность выборки, рассматриваемая как функция параметра $\theta$ при фиксированных наблюдаемых данных:

$$L(\theta) = L(\theta \mid x_1,\dots,x_n) = \prod_{i=1}^n f(x_i;\theta).$$

Оценкой максимального правдоподобия параметра $\theta$ называется значение $\hat\theta_{\text{ММП}}$, максимизирующее функцию правдоподобия:

$$\hat\theta_{\text{ММП}} = \arg\max_{\theta} L(\theta).$$

На практике почти всегда максимизируют не саму $L(\theta)$, а её натуральный логарифм — логарифмическую функцию правдоподобия $\ell(\theta) = \ln L(\theta) = \sum_{i=1}^n \ln f(x_i;\theta)$. Поскольку логарифм — монотонно возрастающая функция, точка максимума не меняется, а сумма логарифмов вычислительно намного удобнее произведения множителей (особенно при больших $n$, где произведение $n$ вероятностей стремительно уходит к нулю и теряется в машинной точности).

Примеры с разбором

Пример 1 (лёгкий). Монету подбросили 20 раз, выпало 14 орлов. Найди ММП-оценку вероятности орла $p$.

Каждый бросок — это испытание Бернулли: вероятность орла $p$, вероятность решки $1-p$. Обозначим число орлов $k=14$, число испытаний $n=20$. Функция правдоподобия (вероятность получить именно такую последовательность из $k$ орлов и $n-k$ решек — с точностью до биномиального коэффициента, который не зависит от $p$ и не влияет на положение максимума):

$$L(p) = p^k(1-p)^{n-k}.$$

Берём логарифм:

$$\ell(p) = k\ln p + (n-k)\ln(1-p).$$

Дифференцируем по $p$ и приравниваем к нулю:

$$\ell'(p) = \frac{k}{p} - \frac{n-k}{1-p} = 0 \quad\Longrightarrow\quad k(1-p) = (n-k)p \quad\Longrightarrow\quad k = np \quad\Longrightarrow\quad \hat p = \frac{k}{n}.$$

Подставляем числа: $\hat p = 14/20 = 0{,}7$.

Ответ: $\hat p_{\text{ММП}} = 0{,}7$. Обрати внимание: метод максимального правдоподобия для распределения Бернулли даёт ровно ту интуитивно очевидную оценку, которой ты, скорее всего, и так бы воспользовался — долю успехов в выборке. Это хороший знак: строгий общий метод воспроизводит здравый смысл там, где здравый смысл и так работает, и при этом даёт формулу для случаев, где интуиция подводит.

Пример 2 (средний). Дана выборка $x_1,\dots,x_n$ из нормального распределения $N(\mu,\sigma^2)$ с неизвестными $\mu$ и $\sigma^2$. Выведи ММП-оценки обоих параметров.

Плотность нормального распределения: $f(x;\mu,\sigma^2) = \dfrac{1}{\sqrt{2\pi\sigma^2}}\exp\left(-\dfrac{(x-\mu)^2}{2\sigma^2}\right)$. Логарифмическая функция правдоподобия для выборки:

$$\ell(\mu,\sigma^2) = \sum_{i=1}^n \ln f(x_i;\mu,\sigma^2) = -\frac{n}{2}\ln(2\pi) - \frac{n}{2}\ln(\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^n (x_i-\mu)^2.$$

Сначала находим оптимальное $\mu$, беря частную производную по $\mu$ (первые два слагаемых от $\mu$ не зависят):

$$\frac{\partial \ell}{\partial \mu} = \frac{1}{\sigma^2}\sum_{i=1}^n (x_i-\mu) = 0 \quad\Longrightarrow\quad \sum_{i=1}^n x_i = n\mu \quad\Longrightarrow\quad \hat\mu = \frac1n\sum_{i=1}^n x_i = \bar x.$$

Теперь находим оптимальное $\sigma^2$, беря частную производную по $\sigma^2$ (обозначим $v=\sigma^2$ для удобства дифференцирования):

$$\frac{\partial \ell}{\partial v} = -\frac{n}{2v} + \frac{1}{2v^2}\sum_{i=1}^n (x_i-\hat\mu)^2 = 0 \quad\Longrightarrow\quad \frac{n}{v} = \frac{1}{v^2}\sum_{i=1}^n(x_i-\hat\mu)^2 \quad\Longrightarrow\quad \hat\sigma^2 = \frac1n\sum_{i=1}^n(x_i-\hat\mu)^2.$$

Ответ: $\hat\mu_{\text{ММП}} = \bar x$ — то же самое выборочное среднее, и $\hat\sigma^2_{\text{ММП}} = \frac1n\sum(x_i-\bar x)^2$ — та самая «наивная» оценка дисперсии из примера 2 предыдущего раздела, которую мы уже показали смещённой! Метод максимального правдоподобия, при всей своей мощи, не гарантирует несмещённость: он даёт оценку с наилучшими асимптотическими свойствами (состоятельность, асимптотическую эффективность), но для конечных выборок смещение возможно, и его иногда приходится корректировать отдельно — как в случае с делением на $n-1$ вместо $n$.

Пример 3 (сложный). Число визитов на сайт за каждый из шести часов работы: 5, 7, 4, 6, 8, 6. Предполагая, что число визитов в час подчиняется распределению Пуассона с параметром $\lambda$, выведи и вычисли ММП-оценку $\lambda$.

Вероятностная функция распределения Пуассона: $f(x;\lambda) = \dfrac{\lambda^x e^{-\lambda}}{x!}$. Логарифмическая функция правдоподобия для выборки $x_1,\dots,x_n$:

$$\ell(\lambda) = \sum_{i=1}^n \left(x_i\ln\lambda - \lambda - \ln(x_i!)\right) = \ln\lambda\sum_{i=1}^n x_i - n\lambda - \sum_{i=1}^n\ln(x_i!).$$

Последнее слагаемое от $\lambda$ не зависит, дифференцируем оставшуюся часть:

$$\ell'(\lambda) = \frac{1}{\lambda}\sum_{i=1}^n x_i - n = 0 \quad\Longrightarrow\quad \hat\lambda = \frac1n\sum_{i=1}^n x_i = \bar x.$$

Подставляем данные: сумма $5+7+4+6+8+6=36$, число наблюдений $n=6$, значит $\hat\lambda = 36/6 = 6$.

Ответ: $\hat\lambda_{\text{ММП}} = 6$ визитов в час. Снова получаем изящный общий результат: для распределения Пуассона ММП-оценка параметра $\lambda$ — это просто выборочное среднее. Это не случайность: для очень многих стандартных распределений (Бернулли, Пуассона, показательного, нормального по $\mu$) ММП-оценка совпадает с интуитивно очевидной статистикой, потому что сама эта статистика и есть достаточная статистика для соответствующего параметра — но это уже тема, выходящая за пределы сегодняшнего урока.

Почему это важно. Метод максимального правдоподобия — это не просто один из инструментов в арсенале статистика. Это единый принцип, по которому строится подавляющее большинство параметрических моделей: от простой подгонки распределения под данные до обучения нейросети с миллиардами параметров. Как только ты формулируешь задачу как «есть параметрическая вероятностная модель, есть данные, нужно подобрать параметры» — у тебя уже есть готовый рецепт: выписать логарифм правдоподобия и найти его максимум (аналитически, как в примерах выше, или численно, градиентным спуском, если аналитического решения нет).


От правдоподобия к функции потерь: как ML использует ММП

Интуиция: минимизация ошибки — это максимизация правдоподобия наоборот

Когда ты обучаешь модель машинного обучения, тебе почти никогда не говорят «максимизируй правдоподобие» — тебе говорят «минимизируй функцию потерь». Но это ровно одно и то же действие, если правильно расставить знаки. Функция потерь для одного наблюдения очень часто определяется как минус логарифм правдоподобия этого наблюдения: $\text{loss}_i = -\ln f(x_i;\theta)$. Минимизация суммарных потерь по всем наблюдениям — это в точности минимизация $-\ell(\theta)$, а значит максимизация $\ell(\theta)$, то есть метод максимального правдоподобия. Знак минус нужен просто потому, что оптимизаторы в машинном обучении по историческим и вычислительным причинам почти всегда настроены на минимизацию, а не на максимизацию.

Это не метафора и не приблизительная аналогия — это буквальное математическое тождество, которое можно вывести для конкретных моделей. Дальше разберём два самых важных случая: логистическую регрессию (где ММП даёт бинарную кросс-энтропию) и линейную регрессию (где ММП при гауссовском шуме даёт среднеквадратичную ошибку).

Определение (вывод): Пусть в задаче бинарной классификации модель для каждого объекта $x_i$ предсказывает вероятность положительного класса $p_i = P(y_i=1\mid x_i)$ (в логистической регрессии — $p_i = \sigma(w^\top x_i)$, где $\sigma$ — сигмоида), а истинная метка $y_i \in \{0,1\}$. Каждое наблюдение — это испытание Бернулли с вероятностью успеха $p_i$, поэтому вклад одного наблюдения в правдоподобие записывается единой формулой (работающей и при $y_i=1$, и при $y_i=0$):

$$L_i = p_i^{y_i}(1-p_i)^{1-y_i}.$$

Логарифмируя и суммируя по всем $n$ независимым наблюдениям, получаем логарифм правдоподобия всей выборки:

$$\ell(w) = \sum_{i=1}^n \big[y_i\ln p_i + (1-y_i)\ln(1-p_i)\big].$$

Взяв минус и разделив на $n$ (чтобы получить среднюю, а не суммарную величину), получаем ровно формулу бинарной кросс-энтропии — стандартной функции потерь логистической регрессии и последнего слоя множества нейросетей для бинарной классификации:

$$\text{BCE}(w) = -\frac1n\sum_{i=1}^n \big[y_i\ln p_i + (1-y_i)\ln(1-p_i)\big] = -\frac{\ell(w)}{n}.$$

Минимизация $\text{BCE}(w)$ по весам $w$ — это в точности максимизация правдоподобия $\ell(w)$.

Примеры с разбором

Пример 1 (лёгкий). Модель логистической регрессии сделала предсказания для трёх объектов: истинные метки $y = [1, 0, 1]$, предсказанные вероятности положительного класса $p = [0{,}9,\ 0{,}2,\ 0{,}7]$. Найди правдоподобие выборки и среднюю бинарную кросс-энтропию.

Для каждого наблюдения вклад в правдоподобие равен $p_i$, если $y_i=1$, и $1-p_i$, если $y_i=0$:

$$L = p_1 \cdot (1-p_2) \cdot p_3 = 0{,}9\cdot0{,}8\cdot0{,}7 = 0{,}504.$$

Логарифм правдоподобия: $\ell = \ln(0{,}504) \approx -0{,}6852$.

Средняя кросс-энтропия — это минус логарифм правдоподобия, делённый на число наблюдений:

$$\text{BCE} = -\frac{\ell}{n} = \frac{0{,}6852}{3} \approx 0{,}2284.$$

Ответ: $L \approx 0{,}504$, средняя кросс-энтропия $\approx 0{,}228$. Чем ближе предсказанные вероятности к истинным меткам, тем выше правдоподобие и тем ниже кросс-энтропия — эти две величины всегда движутся в противоположных направлениях, потому что одна получена из другой знаком минус и логарифмом.

Пример 2 (средний). В задаче линейной регрессии предполагается модель $y_i = c + \varepsilon_i$, где $\varepsilon_i \sim N(0,\sigma^2)$ — независимый гауссовский шум, а $c$ — неизвестная константа (упрощённый случай регрессии без признаков, просто оценка среднего значения целевой переменной). Дана выборка $y = [2,4,6]$. Покажи, что ММП-оценка константы $c$ совпадает с оценкой, минимизирующей сумму квадратов ошибок (MSE).

Поскольку $\varepsilon_i \sim N(0,\sigma^2)$, каждое наблюдение $y_i \sim N(c,\sigma^2)$ с плотностью $f(y_i;c) = \dfrac{1}{\sqrt{2\pi\sigma^2}}\exp\left(-\dfrac{(y_i-c)^2}{2\sigma^2}\right)$. Логарифм правдоподобия:

$$\ell(c) = -\frac{n}{2}\ln(2\pi\sigma^2) - \frac{1}{2\sigma^2}\sum_{i=1}^n (y_i-c)^2.$$

Первое слагаемое от $c$ не зависит, поэтому максимизация $\ell(c)$ по $c$ равносильна минимизации $\sum_{i=1}^n (y_i-c)^2$ — это в точности сумма квадратов ошибок, то есть критерий метода наименьших квадратов. Дифференцируем и приравниваем к нулю:

$$\frac{d}{dc}\sum_{i=1}^n(y_i-c)^2 = -2\sum_{i=1}^n(y_i-c)=0 \quad\Longrightarrow\quad \hat c = \frac1n\sum_{i=1}^n y_i = \frac{2+4+6}{3}=4.$$

Ответ: $\hat c_{\text{ММП}} = 4$ — обычное среднее по выборке, и оно же минимизирует сумму квадратов ошибок. Это общий факт, а не совпадение для конкретных чисел: при гауссовском шуме оценки метода наименьших квадратов (OLS) для линейной регрессии всегда совпадают с оценками максимального правдоподобия — MSE в линейной регрессии не «придумана из общих соображений», она напрямую выведена как минус логарифм правдоподобия при нормальном шуме.

Пример 3 (сложный). Продолжим пример 1: та же выборка $y=[1,0,1]$, но второй набор весов модели дал другие предсказанные вероятности $p' = [0{,}6,\ 0{,}4,\ 0{,}6]$. Сравни правдоподобие двух наборов весов и определи, какой из них лучше объясняет данные.

Для второго набора весов:

$$L' = p'_1\cdot(1-p'_2)\cdot p'_3 = 0{,}6\cdot0{,}6\cdot0{,}6 = 0{,}216.$$

Логарифм: $\ell' = \ln(0{,}216) \approx -1{,}5325$.

Сравниваем: у первого набора весов $\ell \approx -0{,}6852$, у второго $\ell' \approx -1{,}5325$. Поскольку $-0{,}6852 > -1{,}5325$, первый набор весов даёт более высокое правдоподобие.

Ответ: первый набор весов ($p=[0{,}9,0{,}2,0{,}7]$) лучше объясняет наблюдаемые метки, чем второй ($p'=[0{,}6,0{,}4,0{,}6]$) — его правдоподобие выше (соответственно, его кросс-энтропия ниже: $0{,}228$ против $1{,}5325/3\approx0{,}511$). Именно эту разницу в правдоподобии «видит» оптимизатор внутри библиотеки вроде scikit-learn или PyTorch на каждом шаге градиентного спуска: он двигает веса в направлении, увеличивающем правдоподобие данных (эквивалентно — уменьшающем кросс-энтропию), пока не упрётся в (локальный) максимум.

Почему это важно. Понимание того, что функции потерь в машинном обучении — это не набор произвольных инженерных находок, а прямое следствие метода максимального правдоподобия при конкретном предположении о распределении шума или меток, даёт тебе мощный инструмент: если стандартная функция потерь не подходит под твою задачу (например, данные с выбросами или счётные данные с распределением Пуассона), ты можешь вывести подходящую функцию потерь заново, просто сменив предположение о распределении и повторив тот же вывод — минус логарифм правдоподобия для нового распределения. Именно так, например, выводится потеря Пуассона (Poisson loss) для регрессии на счётные данные или категориальная кросс-энтропия для многоклассовой классификации с softmax.


Практика: 30 заданий

Базовые (задания 1–10)

Задание 1. Выборка из пяти чеков интернет-магазина: 450, 600, 380, 720, 550 рублей. Найди точечную оценку среднего чека.


Задание 2. Объясни, в чём разница между утверждениями «средний рост студентов — 175 см» и «средний рост студентов от 172 до 178 см с уверенностью 95%». Какое из них точечная оценка, а какое — интервальная?


Задание 3. Известно, что оценка $\hat\theta$ параметра $\theta$ имеет математическое ожидание $\mathbb{E}[\hat\theta] = \theta + 2$. Найди смещение этой оценки и определи, является ли она несмещённой.


Задание 4. Дана малая выборка $\{3, 5, 7\}$. Найди точечную оценку среднего и несмещённую оценку дисперсии.


Задание 5. Монету бросили 20 раз, выпало 14 орлов. Найди ММП-оценку вероятности выпадения орла.


Задание 6. Точечная оценка среднего $\hat\mu=100$, дисперсия генеральной совокупности известна и равна $\sigma^2=225$, объём выборки $n=225$. Построй 95%-й доверительный интервал для истинного среднего.


Задание 7. Объясни своими словами, в чём разница между несмещённостью и состоятельностью оценки, на примере оценки «взять только первое наблюдение выборки» как оценки среднего.


Задание 8. Число визитов на сайт по часам: 5, 7, 4, 6, 8, 6. Предполагая распределение Пуассона, найди ММП-оценку параметра $\lambda$.


Задание 9. На заводе проверили 500 деталей, из них 15 оказались бракованными. Найди точечную оценку доли брака.


Задание 10. Модель бинарной классификации для одного объекта с истинной меткой $y=1$ предсказала вероятность положительного класса $p=0{,}8$. Найди вклад этого наблюдения в отрицательное логарифмическое правдоподобие (кросс-энтропийные потери).


Средние (задания 11–20)

Задание 11. Выведи в общем виде ММП-оценку параметра $p$ распределения Бернулли по выборке из $n$ независимых испытаний с $k$ успехами.


Задание 12. Докажи в общем виде, что выборочное среднее $\hat\mu = \frac1n\sum X_i$ — несмещённая оценка математического ожидания $\mu$ произвольного распределения с конечным средним.


Задание 13. В A/B-тесте показали новую кнопку 1000 раз, получили 45 кликов. Построй 95%-й доверительный интервал для истинной конверсии, используя $\text{погрешность} = z\sqrt{\hat p(1-\hat p)/n}$.


Задание 14. Для выборки $\{2,4,6,8,10\}$ посчитай смещённую (деление на $n$) и несмещённую (деление на $n-1$) оценки дисперсии.


Задание 15. Выборка $\{10,12,14,16,18\}$ предполагается нормально распределённой. Найди ММП-оценки $\hat\mu$ и $\hat\sigma^2$.


Задание 16. Распределение имеет дисперсию $\sigma^2=25$. Сравни дисперсию оценки «взять первое наблюдение» $\hat\mu_{\text{перв}}=X_1$ с дисперсией выборочного среднего $\hat\mu$ при объёме выборки $n=25$.


Задание 17. Модель предсказала вероятности положительного класса $p=[0{,}9,\ 0{,}2,\ 0{,}7]$ для объектов с истинными метками $y=[1,0,1]$. Найди правдоподобие выборки, логарифм правдоподобия и среднюю бинарную кросс-энтропию.


Задание 18. Модель константы $c$ предсказывает целевую переменную при гауссовском шуме, дана выборка $y=[2,4,6]$. Покажи, что ММП-оценка $c$ совпадает со средним, минимизирующим сумму квадратов ошибок.


Задание 19. Две несмещённые оценки одного и того же параметра имеют дисперсии $\text{Var}(\hat\theta_1) = 4/n$ и $\text{Var}(\hat\theta_2) = 9/n$. Какая оценка эффективнее и почему?


Задание 20. Выведи в общем виде ММП-оценку параметра $\lambda$ распределения Пуассона по выборке $x_1,\dots,x_n$.


Продвинутые (задания 21–30)

Задание 21. Выведи в общем виде обе ММП-оценки $\hat\mu$ и $\hat\sigma^2$ для нормального распределения $N(\mu,\sigma^2)$ по выборке $x_1,\dots,x_n$, дифференцируя логарифм правдоподобия по обоим параметрам.


Задание 22. Докажи, что ММП-оценка дисперсии нормального распределения $\hat\sigma^2_{\text{ММП}}$ смещена, с множителем $\frac{n-1}{n}$, и найди величину занижения (в процентах) при $n=10$.


Задание 23. Выведи в общем виде формулу бинарной кросс-энтропии из метода максимального правдоподобия для схемы Бернулли с предсказанными вероятностями $p_i$ и истинными метками $y_i \in \{0,1\}$.


Задание 24. Для того же датасета, что и в задании 17 ($y=[1,0,1]$), второй набор весов дал предсказания $p'=[0{,}6,\ 0{,}4,\ 0{,}6]$. Посчитай логарифм правдоподобия для второго набора и определи, какой набор весов лучше.


Задание 25. Для доверительного интервала среднего при $\sigma=20$ сравни ширину 95%-го интервала при $n=100$ и при $n=400$.


Задание 26. Для нормально распределённых данных дисперсия выборочной медианы асимптотически равна $\frac{\pi}{2}\cdot\frac{\sigma^2}{n}$, а дисперсия выборочного среднего равна $\frac{\sigma^2}{n}$. Найди относительную эффективность медианы по сравнению со средним.


Задание 27. Выведи в общем виде, что ММП-оценки коэффициентов линейной регрессии $y_i = b_0+b_1x_i+\varepsilon_i$ при гауссовском шуме $\varepsilon_i \sim N(0,\sigma^2)$ совпадают с оценками метода наименьших квадратов.


Задание 28. Найди величину смещения ММП-оценки дисперсии нормального распределения (множитель $(n-1)/n$) при $n=5$, $n=50$ и $n=500$, и опиши тенденцию.


Задание 29. Время между кликами пользователя на сайте (в минутах) за пять интервалов: $\{2,3,1,4,5\}$. Предполагая показательное (экспоненциальное) распределение с параметром $\lambda$, выведи формулу ММП-оценки и вычисли её значение.


Задание 30. Оцени по всем трём критериям (несмещённость, состоятельность, эффективность) ММП-оценку дисперсии нормального распределения $\hat\sigma^2_{\text{ММП}} = \frac1n\sum(x_i-\bar x)^2$, и опиши, что происходит с каждым из трёх свойств при росте объёма выборки.


Частые ошибки

Ошибка: «Несмещённая оценка всегда близка к истинному значению параметра» ✅ Правильно: Несмещённость — это свойство среднего оценки по всем возможным выборкам, а не гарантия точности на конкретной выборке 💡 Почему: Оценка «взять первое наблюдение» несмещена, но может сильно отклоняться от истины на конкретной выборке — она просто не смещена систематически в одну сторону. Несмещённость ничего не говорит о разбросе отдельных значений оценки.

Ошибка: «Оценка дисперсии всегда делится на $n$, как в формуле дисперсии из курса вероятности» ✅ Правильно: Для несмещённой оценки дисперсии по выборке нужно делить на $n-1$, а не на $n$ 💡 Почему: Деление на $n$ даёт смещённую оценку, систематически занижающую истинную дисперсию в $(n-1)/n$ раз, потому что выборочное среднее $\hat\mu$ само подстраивается под конкретную выборку и оказывается немного ближе к данным, чем истинное $\mu$ — отсюда и «недостача» в один пункт, известная как потеря одной степени свободы.

Ошибка: «ММП-оценка всегда несмещена, раз это “лучший” метод оценки параметров» ✅ Правильно: ММП-оценка гарантированно обладает хорошими асимптотическими свойствами (состоятельность, асимптотическая эффективность), но может быть смещена при конечном объёме выборки 💡 Почему: ММП-оценка дисперсии нормального распределения смещена с множителем $(n-1)/n$ — это прямо показано в примере 2 и задании 22. Метод максимального правдоподобия оптимизирует правдоподобие, а не напрямую несмещённость.

Ошибка: «95%-й доверительный интервал означает, что истинный параметр с вероятностью 95% лежит именно в этом конкретном интервале» ✅ Правильно: Истинный параметр — фиксированное, хоть и неизвестное число, а не случайная величина; случаен именно интервал, построенный по случайной выборке 💡 Почему: Правильная интерпретация: если повторить процедуру построения интервала на множестве разных выборок, около 95% построенных интервалов накроют истинное значение. Для одного конкретного уже построенного интервала истинный параметр либо лежит внутри, либо нет — вероятность здесь относится к процедуре, а не к конкретному результату.

Ошибка: «Функция потерь в машинном обучении и метод максимального правдоподобия — это два разных, не связанных друг с другом подхода» ✅ Правильно: Бинарная кросс-энтропия и MSE — это минус логарифм правдоподобия для конкретных предположений о распределении (Бернулли и нормальное соответственно), а не независимо придуманные инженерные формулы 💡 Почему: Мы напрямую вывели обе функции потерь из принципа максимального правдоподобия в блоке про связь ММП и функций потерь — минимизация кросс-энтропии эквивалентна максимизации правдоподобия схемы Бернулли, минимизация MSE эквивалентна максимизации правдоподобия при гауссовском шуме.

Ошибка: «Чем больше выборка, тем меньше нужно заботиться о выборе оценки — все оценки в итоге сойдутся к истине» ✅ Правильно: Только состоятельные оценки сходятся к истинному значению при росте выборки; несостоятельная оценка (как «первое наблюдение») не улучшается вообще, сколько бы данных ни добавлялось 💡 Почему: Пример с оценкой $\hat\mu_{\text{перв}}=X_1$ показывает: её дисперсия остаётся равной $\sigma^2$ при любом $n$, тогда как дисперсия выборочного среднего падает как $\sigma^2/n$. Выбор формы оценки имеет значение независимо от размера выборки.


Главное запомнить

Точечная оценка $\hat\theta$ — одно число, приближающее неизвестный параметр; интервальная оценка (доверительный интервал) — диапазон значений с заданным уровнем доверия $1-\alpha$

✅ Простой доверительный интервал для среднего строится как $\hat\mu \pm z_{1-\alpha/2}\cdot \sigma/\sqrt n$ — ширина интервала убывает как $1/\sqrt n$

Несмещённость: $\mathbb{E}[\hat\theta]=\theta$ при любом $n$ — среднее оценки по всем возможным выборкам совпадает с истинным параметром

Состоятельность: $\hat\theta_n \xrightarrow{P} \theta$ при $n\to\infty$ — оценка сходится к истине с ростом выборки; для многих оценок следует напрямую из закона больших чисел (урок 242)

Эффективность: среди несмещённых оценок лучшая — та, у которой минимальная дисперсия; несмещённость сама по себе не гарантирует ни состоятельности, ни эффективности

✅ Оценка дисперсии с делением на $n$ смещена с множителем $(n-1)/n$; деление на $n-1$ устраняет смещение

Метод максимального правдоподобия: $\hat\theta_{\text{ММП}} = \arg\max_\theta L(\theta)$, на практике максимизируется логарифм правдоподобия $\ell(\theta)=\sum\ln f(x_i;\theta)$

✅ Для Бернулли ММП-оценка — доля успехов $k/n$; для нормального распределения — среднее $\bar x$ и (смещённая) дисперсия $\frac1n\sum(x_i-\bar x)^2$; для Пуассона и показательного распределения — тоже выражается через выборочное среднее

✅ Бинарная кросс-энтропия — это минус усреднённый логарифм правдоподобия схемы Бернулли; MSE в линейной регрессии — это минус логарифм правдоподобия при гауссовском шуме

✅ ММП-оценки не обязаны быть несмещёнными при конечном $n$, но при общих условиях они состоятельны и асимптотически эффективны — это главный результат теории Фишера


Связь с другими темами курса

🔙 Откуда пришли: Из урока 245 — понятия выборки и генеральной совокупности, без которых сама идея «оценки параметра по выборке» не имеет смысла; из урока 242 — закон больших чисел, который напрямую обосновывает состоятельность выборочного среднего и большинства ММП-оценок; из урока 241 — центральная предельная теорема, на которой держится нормальное приближение, используемое при построении доверительных интервалов

🔜 Куда идём:

  • Проверка статистических гипотез (урок 247) — использует те же оценки и доверительные интервалы для формального принятия решений о значимости различий
  • Критерий хи-квадрат (урок 248) — частный случай проверки гипотез, где тоже фигурируют оценки параметров распределения
  • Регрессионный анализ (урок 249) — прямое продолжение примеров этого урока: коэффициенты линейной регрессии — это ММП-оценки при гауссовском шуме, выведенные здесь в общем виде

🎯 В машинном обучении: Обучение любой параметрической модели — логистической регрессии, линейной регрессии, наивного байеса, многих нейросетей — формально является задачей оценки параметров методом максимального правдоподобия; кросс-энтропия и MSE — это не отдельно придуманные инженерные функции потерь, а минус логарифм правдоподобия для конкретных распределений; несмещённость и состоятельность оценки среднего и дисперсии стоят за корректностью метрик качества модели на тестовой выборке, а состоятельность самой ММП-оценки опирается на закон больших чисел из урока 242


Интересные факты

📌 Термин «правдоподобие» (likelihood) Рональд Фишер специально ввёл, чтобы отличать его от «вероятности» (probability): вероятность — это функция данных при фиксированном параметре, а правдоподобие — функция параметра при фиксированных данных. Путаница между этими двумя понятиями остаётся одной из самых частых логических ошибок в начальном изучении статистики даже спустя сто лет после того, как Фишер провёл это разграничение.

📌 Деление суммы квадратов отклонений на $n-1$, а не на $n$, при оценке дисперсии называют «поправкой Бесселя» — по имени немецкого математика и астронома Фридриха Бесселя, который использовал похожую идею коррекции ещё в начале XIX века при обработке астрономических наблюдений, задолго до того, как Фишер формализовал само понятие несмещённости.

📌 Формально ММП может не иметь аналитического решения — для большинства современных моделей машинного обучения (логистическая регрессия с многими признаками, нейросети) логарифм правдоподобия не удаётся максимизировать через явную формулу вроде $\hat p=k/n$, и вместо этого используется численная оптимизация — тот самый градиентный спуск, которым обучается почти всё современное машинное обучение, — итеративно приближающая максимум правдоподобия шаг за шагом.

📌 Неравенство Рао — Крамера, доказанное независимо Калямпуди Радхакришной Рао и Харальдом Крамером в 1940-х годах, задаёт теоретический нижний предел дисперсии, которого в принципе может достичь любая несмещённая оценка данного параметра. Оценка, дисперсия которой в точности равна этому пределу, называется эффективной в самом строгом смысле — и метод максимального правдоподобия при больших выборках асимптотически приближается именно к этой границе, что и делает его настолько универсальным инструментом.

📌 Хотя Гаусс фактически использовал идею, эквивалентную максимизации правдоподобия, ещё в начале 1800-х годов при выводе метода наименьших квадратов, он не выделил и не назвал этот принцип отдельно, — общий метод, применимый к произвольному распределению, а не только к нормальному, появился только спустя сто с лишним лет благодаря Фишеру.


Лайфхаки и полезные трюки

💡 Всегда максимизируй логарифм правдоподобия, а не саму функцию правдоподобия: произведение большого числа вероятностей (каждая меньше единицы) при росте выборки стремительно уходит к нулю и «теряется» в машинной точности вычислений с плавающей запятой — сумма логарифмов этой проблемы лишена.

💡 Если тебе нужно быстро прикинуть, как выглядит ММП-оценка для нового распределения, не заучивай формулы — заучи саму процедуру: выписать плотность (или вероятностную функцию), прологарифмировать произведение по выборке, продифференцировать по параметру, приравнять к нулю и решить. Этот алгоритм из четырёх шагов работает для любого параметрического семейства, у которого плотность гладко зависит от параметра.

💡 Если в библиотеке для статистики или машинного обучения видишь параметр ddof (delta degrees of freedom) у функции вычисления дисперсии или стандартного отклонения (например, в numpy.std), помни: ddof=0 даёт смещённую ММП-оценку (деление на $n$), ddof=1 — несмещённую оценку (деление на $n-1$). По умолчанию numpy использует ddof=0, а многие статистические пакеты — ddof=1, поэтому одна и та же выборка может дать чуть разные числа в разных библиотеках.

💡 Когда видишь в документации библиотеки формулу функции потерь (кросс-энтропия, MSE, потеря Пуассона, отрицательное биномиальное правдоподобие), попробуй мысленно восстановить, из какого распределения она выведена как минус логарифм правдоподобия — это сразу подскажет, для каких данных эта функция потерь статистически обоснована (например, MSE предполагает гауссовский, симметричный шум и плохо подходит для данных с сильными выбросами).

💡 Перед тем как доверять точечной оценке метрики модели (accuracy, средняя ошибка, конверсия в A/B-тесте), всегда прикидывай хотя бы приблизительный доверительный интервал по формуле $\hat\theta \pm 1{,}96\cdot\sqrt{\text{дисперсия}/n}$ — это дёшево посчитать и сразу отсеивает ложные выводы вида «метрика выросла на 0,3 процентного пункта», когда эта разница целиком укладывается в статистический шум выборки.


Финишная черта этого урока — это одновременно и мостик вперёд. Ты теперь умеешь не просто «взять число из данных», а понимать, что стоит за этим числом: насколько оно смещено, насколько оно устойчиво при росте выборки, и есть ли способ получить оценку получше. А метод максимального правдоподобия дал тебе не рецепт для одной конкретной задачи, а универсальный принцип: выписать, насколько вероятны твои данные при разных значениях параметра, и выбрать то значение, которое делает их наиболее правдоподобными. В следующем уроке ты возьмёшь эти же оценки и научишься формально проверять гипотезы о них — отвечать на вопрос не просто «чему равен параметр», а «отличается ли он значимо от какого-то контрольного значения», что и является следующим логическим шагом после того, как ты научился этот параметр оценивать.

Понял тему? Закрепи в боте! 🚀

Попрактикуйся на задачах и получи персональные рекомендации от AI

💪 Начать тренировку
💬 Есть вопрос? Спроси бота!