Многомерные случайные величины 📐
Открой любой датасет для задачи классификации оттока клиентов. Одна строка — это не одно число. Это возраст клиента, его доход, количество месяцев подписки, число обращений в поддержку и, наконец, метка — ушёл клиент или нет. Шесть чисел, записанных в одну строку таблицы, но пришедших из одного и того же случайного эксперимента: «взять случайного клиента компании и записать про него всё, что нужно». До этого урока ты умел работать только с одной случайной величиной за раз — с одним столбцом. А реальные данные почти никогда не бывают одним столбцом.
Формально то, что стоит за строкой таблицы, называется случайным вектором — это одна из тех идей, которые кажутся тривиальными, пока ты не пытаешься сформулировать её строго. Ты уже знаешь, что такое случайная величина $X$: числовая функция на пространстве элементарных исходов, урок 234. Случайный вектор — это просто несколько таких функций, определённых на одном и том же пространстве исходов, рассматриваемых одновременно, как единое целое $(X_1, X_2, \dots, X_n)$. Ключевое слово здесь — «одновременно». Про возраст и доход одного и того же клиента можно говорить отдельно (одномерные распределения ты уже умеешь строить), но как только тебя интересует вопрос «а у людей с высоким доходом отток ниже?», одномерных распределений уже недостаточно. Нужно совместное распределение — то, как эти величины ведут себя вместе.
Именно совместное распределение признаков и целевой переменной — фундамент всего обучения с учителем. Когда ты обучаешь модель регрессии или классификации, ты, по сути, пытаешься нащупать одну конкретную часть совместного распределения: условное распределение $p(y \mid x)$ — распределение целевой переменной $y$ при фиксированном значении признаков $x$. Логистическая регрессия явно моделирует $p(y=1 \mid x)$. Наивный байесовский классификатор явно опирается на условную независимость признаков при известном классе. Даже нейросеть с softmax на выходе — это параметрическое приближение того же самого условного распределения. Ничего из этого не имеет смысла, пока не определены базовые понятия: что такое совместное распределение, как из него получить распределение одной компоненты (это называется маргинализацией — забыть про остальные признаки), как получить условное распределение, и что вообще означает независимость двух случайных величин на строгом языке, а не на уровне интуиции «связаны — не связаны».
Этот урок — про фундамент, без картинок с нейросетями и метриками. Но каждое понятие здесь будет сопровождаться ML-примером, потому что вся современная статистика и машинное обучение построены именно на этих четырёх кирпичиках: совместное распределение, маргинальное распределение, условное распределение, независимость.
🎯 Ты узнаешь:
- Что такое случайный вектор и почему строка таблицы данных — это ровно он
- Как задаются совместная функция распределения и совместная плотность вероятности для нескольких случайных величин сразу
- Как получить распределение одной компоненты вектора, «забыв» про остальные — то есть что такое маргинализация и откуда взялось само слово «маргинальный»
- Что такое условное распределение и почему $p(y \mid x)$ — это именно то, что учится классификатор или регрессионная модель
- Как строго определяется независимость случайных величин через факторизацию совместной плотности — и почему это определение сильнее, чем «корреляция равна нулю»
История: откуда это взялось?
Систематическое изучение пар случайных величин началось не с абстрактной математики, а с очень конкретного человеческого любопытства. В 1880-х годах английский учёный Фрэнсис Гальтон — двоюродный брат Чарльза Дарвина, одержимый измерением всего подряд — собрал данные о росте более тысячи пар «родитель–ребёнок». Гальтона интересовал не рост родителей сам по себе и не рост детей сам по себе — эти одномерные распределения он уже прекрасно умел строить. Его интересовало, как эти два числа связаны между собой у одной и той же семьи. Он раскладывал пары измерений в таблицу, где по строкам шёл рост родителя, а по столбцам — рост ребёнка, и в каждой клетке записывал, сколько семей попало в эту комбинацию. Это была, по сути, первая в истории эмпирическая совместная таблица распределения двух случайных величин.
Дальше идею подхватил и формализовал математически Карл Пирсон, ученик и последователь Гальтона. Именно Пирсон в 1890-х годах ввёл понятие «таблицы сопряжённости» (contingency table) и стал систематически суммировать её по строкам и по столбцам, чтобы получить распределение каждой переменной отдельно. Эти суммы записывались на полях таблицы — буквально на её краях, margin по-английски. Отсюда и пошёл термин маргинальное распределение: не потому что оно «второстепенное» или «неважное», а буквально потому, что исторически его вычисляли и записывали на полях статистических таблиц. Забавный факт: слово, которое сегодня для многих ассоциируется с чем-то периферийным, на самом деле означает одно из самых рабочих понятий всей теории вероятностей.
Строгое, аксиоматическое определение случайного вектора появилось значительно позже — в 1933 году, когда советский математик Андрей Николаевич Колмогоров опубликовал «Основные понятия теории вероятностей», заложив современную аксиоматику через теорию меры. В этой системе случайный вектор — это просто измеримое отображение из пространства элементарных исходов $\Omega$ в $\mathbb{R}^n$, а совместное распределение — это мера, которую это отображение индуцирует на $\mathbb{R}^n$. Никакой магии, никакой отдельной новой теории — ровно та же конструкция, что для одной случайной величины (урок 234), только координат стало несколько. Именно эта абстракция и позволила без изменений перенести всю машинерию теории вероятностей на датасеты с сотнями и тысячами признаков — то, с чем сегодня работает любая модель машинного обучения.
Случайный вектор и совместное распределение
Интуиция: вектор — это строка таблицы
Представь, что ты собираешь датасет о квартирах для модели, предсказывающей цену. Для каждой квартиры ты записываешь площадь, этаж, расстояние до метро и цену. Каждая квартира — это отдельный «прогон» случайного эксперимента: ты не знаешь заранее, какая квартира попадётся в выборку, поэтому площадь, этаж, расстояние и цена этой квартиры — случайные величины. Но это не четыре независимых, никак не связанных друг с другом эксперимента. Это один эксперимент («взять случайную квартиру из рынка»), у которого сразу четыре числовых результата. Вот эта четвёрка чисел, рассматриваемая как единое целое, и есть случайный вектор.
Важно почувствовать разницу между «четырьмя случайными величинами» и «случайным вектором из четырёх компонент». Формально это одно и то же множество объектов, но вектор подчёркивает, что нас интересует не каждая координата по отдельности, а их совместное поведение — то, как они меняются согласованно. Именно это совместное поведение и содержит всю интересную информацию: связь площади с ценой, связь этажа с расстоянием до метро и так далее.
Определение: Случайный вектор $\mathbf{X} = (X_1, X_2, \dots, X_n)$ — это набор случайных величин, определённых на одном и том же вероятностном пространстве $(\Omega, \mathcal{F}, P)$, то есть заданных одним и тем же случайным экспериментом. Совместной функцией распределения случайного вектора называется функция
$$F(x_1, x_2, \dots, x_n) = P(X_1 \le x_1,\ X_2 \le x_2,\ \dots,\ X_n \le x_n).$$Для непрерывного случайного вектора, если такая функция существует, совместной плотностью вероятности называется функция $f(x_1, \dots, x_n) \ge 0$, для которой
$$F(x_1, \dots, x_n) = \int_{-\infty}^{x_1} \cdots \int_{-\infty}^{x_n} f(t_1, \dots, t_n)\, dt_n \cdots dt_1, \qquad \int_{\mathbb{R}^n} f(t_1, \dots, t_n)\, dt_1 \cdots dt_n = 1.$$
Для двумерного случая, с которым мы будем работать чаще всего, запись упрощается до $F(x,y) = P(X \le x,\ Y \le y)$ и $f(x,y) = \dfrac{\partial^2 F(x,y)}{\partial x\, \partial y}$. Вероятность попадания вектора в область $D$ на плоскости считается как объём под поверхностью плотности над этой областью:
$$P((X,Y) \in D) = \iint_D f(x,y)\, dx\, dy.$$Обрати внимание: совместная плотность — это не «две плотности рядом», а одна функция двух переменных. Её график — это поверхность над плоскостью $(x,y)$, а не две кривые. Именно эта поверхность и кодирует всю информацию о том, как $X$ и $Y$ связаны.
Примеры с разбором
Пример 1 (лёгкий). Дискретный случайный вектор $(X,Y)$ описывает клиента интернет-магазина: $X$ — есть ли у него оформленная подписка на рассылку ($X=0$ — нет, $X=1$ — да), $Y$ — совершил ли он покупку в этом месяце ($Y=0$ — нет, $Y=1$ — да). Совместное распределение задано таблицей:
| $Y=0$ | $Y=1$ | |
|---|---|---|
| $X=0$ | 0,45 | 0,15 |
| $X=1$ | 0,10 | 0,30 |
Проверим, что перед нами действительно совместное распределение: все числа неотрицательны, и их сумма $0{,}45+0{,}15+0{,}10+0{,}30 = 1{,}00$ — условие нормировки выполнено. Найдём, например, вероятность того, что случайный клиент из этого магазина имеет подписку и совершил покупку: по таблице это ровно клетка $(X{=}1, Y{=}1)$, то есть $P(X=1, Y=1) = 0{,}30$. Это и есть значение совместного распределения в одной точке — никакого интегрирования не нужно, потому что вектор дискретный.
Пример 2 (средний). Совместная плотность непрерывного случайного вектора $(X,Y)$ задана формулой $f(x,y) = x + y$ на квадрате $0 \le x \le 1,\ 0 \le y \le 1$, и $f(x,y)=0$ вне этого квадрата. Проверим условие нормировки:
$$\int_0^1 \int_0^1 (x+y)\, dx\, dy = \int_0^1 \left[\frac{x^2}{2} + xy\right]_{x=0}^{1} dy = \int_0^1 \left(\frac{1}{2} + y\right) dy = \frac{1}{2} + \frac{1}{2} = 1.$$Отлично, это действительно корректная плотность. Теперь найдём вероятность того, что оба значения окажутся меньше $\tfrac{1}{2}$, то есть $P\left(X < \tfrac12,\ Y < \tfrac12\right)$:
$$\int_0^{1/2}\int_0^{1/2} (x+y)\, dx\, dy = \int_0^{1/2}\left[\frac{x^2}{2}+xy\right]_{x=0}^{1/2} dy = \int_0^{1/2}\left(\frac{1}{8}+\frac{y}{2}\right) dy = \frac{1}{16} + \frac{1}{16} = \frac{1}{8}.$$Обрати внимание: если бы $X$ и $Y$ были независимы и каждая равномерна на $[0,1]$, вероятность попадания обеих в нижнюю левую четверть квадрата была бы $\tfrac12 \cdot \tfrac12 = \tfrac14$. У нас получилось $\tfrac18$ — заметно меньше. Это первый намёк на то, что плотность $f(x,y)=x+y$ «выталкивает» вектор в сторону больших значений (там, где и $x$, и $y$ велики, плотность максимальна), и в область малых значений он попадает реже, чем при независимости.
Пример 3 (сложный). Случайный вектор $(X,Y)$ равномерно распределён внутри треугольника с вершинами $(0,0)$, $(1,0)$, $(0,1)$, то есть внутри области $\{x \ge 0,\ y \ge 0,\ x+y \le 1\}$. Площадь этого треугольника равна $\tfrac12$, а «равномерно распределён» означает, что плотность постоянна на области и равна обратной величине её площади:
$$f(x,y) = \frac{1}{\text{площадь}} = 2 \quad \text{при } x \ge 0,\ y \ge 0,\ x+y \le 1, \qquad f(x,y) = 0 \text{ иначе}.$$Найдём $P(X > Y)$ — вероятность того, что первая координата больше второй. Заметь важную структурную деталь: треугольник с вершинами $(0,0)$, $(1,0)$, $(0,1)$ симметричен относительно прямой $x=y$ — замена $x \leftrightarrow y$ переводит треугольник сам в себя. Раз плотность на нём постоянна, то вероятность попасть в половину треугольника выше диагонали $x=y$ равна вероятности попасть в половину ниже диагонали, а вероятность попасть ровно на диагональ у непрерывного распределения равна нулю. Значит,
$$P(X>Y) = P(Y>X) = \frac{1}{2}.$$Проверим это прямым интегрированием, без ссылки на симметрию — на случай, если тебе достанется область без такой удобной симметрии:
$$P(X>Y) = \int_0^1 \int_0^x 2\, dy\, dx = \int_0^1 2x\, dx = \left[x^2\right]_0^1 = 1.$$Стоп — это неверно, потому что мы забыли учесть ограничение $x+y \le 1$: при $y$ от $0$ до $x$ нужно ещё требовать $y \le 1-x$, а поскольку при $x \le \tfrac12$ имеем $x \le 1-x$, верхняя граница интегрирования по $y$ — это $\min(x,\ 1-x)$, а не просто $x$. Разобьём интеграл на два куска. При $0 \le x \le \tfrac12$ верхняя граница $y$ равна $x$ (треугольник ещё не «упёрся» в гипотенузу), при $\tfrac12 \le x \le 1$ верхняя граница $y$ равна $1-x$:
$$P(X>Y) = \int_0^{1/2} \int_0^{x} 2\, dy\, dx + \int_{1/2}^{1} \int_0^{1-x} 2\, dy\, dx = \int_0^{1/2} 2x\, dx + \int_{1/2}^{1} 2(1-x)\, dx.$$Первый интеграл: $\left[x^2\right]_0^{1/2} = \tfrac14$. Второй интеграл, подставим $u=1-x$: $\int_0^{1/2} 2u\, du = \left[u^2\right]_0^{1/2} = \tfrac14$. Сумма: $\tfrac14+\tfrac14 = \tfrac12$. Аккуратный прямой подсчёт подтвердил результат из симметрии: $P(X>Y) = \tfrac12$. Мораль этого примера двойная: во-первых, симметрия — мощный短кат, который экономит массу вычислений; во-вторых, при прямом интегрировании по неправильной, не прямоугольной области обязательно нужно аккуратно выписывать границы, иначе легко получить абсурдный ответ вроде единицы там, где должна быть половина.
Почему это важно. Случайный вектор — это единственный корректный способ говорить о нескольких признаках объекта одновременно. Когда ты видишь в документации библиотеки scikit-learn матрицу признаков X формы (n_samples, n_features), каждая строка этой матрицы — это одна реализация случайного вектора. Совместное распределение этого вектора — это, по сути, то самое неизвестное «истинное» распределение данных, из которого якобы выбираются объекты для обучения и теста. Вся статистическая теория обучения — обобщающая способность моделей, переобучение, генерализация — формулируется именно в терминах того, что тренировочная и тестовая выборки — это независимые реализации одного и того же случайного вектора $(\mathbf{X}, Y)$.
Маргинальные (частные) распределения
Интуиция: забыть про остальные признаки
Вернёмся к таблице подписчиков магазина из примера 1. У нас есть совместное распределение пары $(X,Y)$: подписка и покупка. Но иногда тебя интересует только один вопрос: «Какая доля всех клиентов вообще совершает покупки в этом месяце, независимо от того, подписаны они на рассылку или нет?» Чтобы ответить, нужно просуммировать по всем возможным значениям $X$, то есть «забыть» про подписку и оставить только покупку. Именно эта операция — суммирование (или интегрирование в непрерывном случае) по всем значениям остальных компонент вектора — и называется маргинализацией, а результат — маргинальным, или частным, распределением.
Представь себе таблицу совместного распределения как электронную таблицу: у неё есть строки, столбцы и итоговая сумма по каждой строке и каждому столбцу — те самые числа «на полях», от которых пошло название. Сумма по столбцу $Y=1$ говорит тебе о распределении $Y$ отдельно, «забыв» про $X$. Сумма по строке $X=1$ говорит о распределении $X$ отдельно, «забыв» про $Y$.
Определение: Маргинальным (частным) распределением случайной величины $X$, входящей в состав случайного вектора $(X,Y)$, называется её собственное, одномерное распределение, полученное «забыванием» про $Y$. Для дискретного случая:
$$P(X = x) = \sum_{y} P(X=x,\ Y=y).$$Для непрерывного случая, с совместной плотностью $f(x,y)$, маргинальная плотность $X$:
$$f_X(x) = \int_{-\infty}^{+\infty} f(x,y)\, dy.$$Аналогично для $Y$: $P(Y=y)=\sum_x P(X=x,Y=y)$ или $f_Y(y) = \int_{-\infty}^{+\infty} f(x,y)\, dx$.
Название «маргинальное» иногда пугает новичков — кажется, что это что-то второстепенное. На самом деле это ровно то одномерное распределение, с которым ты работал во всех предыдущих уроках раздела теории вероятностей: просто теперь ты видишь, что оно всегда было «встроено» в какое-то более крупное совместное распределение, из которого его можно извлечь суммированием или интегрированием.
Примеры с разбором
Пример 1 (лёгкий). Возьмём таблицу подписчиков из предыдущего раздела:
| $Y=0$ | $Y=1$ | Сумма по строке | |
|---|---|---|---|
| $X=0$ | 0,45 | 0,15 | 0,60 |
| $X=1$ | 0,10 | 0,30 | 0,40 |
| Сумма по столбцу | 0,55 | 0,45 | 1,00 |
Маргинальное распределение $X$ (подписка) получается суммированием по строкам: $P(X=0) = 0{,}45+0{,}15 = 0{,}60$, $P(X=1) = 0{,}10+0{,}30 = 0{,}40$. Значит, $60\%$ клиентов не подписаны, $40\%$ подписаны — независимо от того, покупали они или нет. Маргинальное распределение $Y$ (покупка) получается суммированием по столбцам: $P(Y=0)=0{,}45+0{,}10=0{,}55$, $P(Y=1)=0{,}15+0{,}30=0{,}45$. То есть в целом по всей клиентской базе покупку в этом месяце совершают $45\%$ клиентов. Заметь: чтобы ответить на вопрос «какая доля клиентов покупает», нам не нужно было знать ничего про подписку — она «стёрлась» в процессе суммирования.
Пример 2 (средний). Для совместной плотности $f(x,y) = x+y$ на квадрате $[0,1]\times[0,1]$ из предыдущего раздела найдём маргинальную плотность $X$:
$$f_X(x) = \int_0^1 (x+y)\, dy = \left[xy + \frac{y^2}{2}\right]_{y=0}^{1} = x + \frac{1}{2}, \qquad x \in [0,1].$$Проверим нормировку получившейся одномерной плотности:
$$\int_0^1 \left(x+\frac{1}{2}\right) dx = \frac{1}{2}+\frac{1}{2} = 1 \quad \checkmark$$Отлично, это корректная плотность. По симметрии формулы относительно $x$ и $y$ сразу получаем $f_Y(y) = y + \tfrac12$ на $[0,1]$. Обрати внимание на интуитивный смысл: у $X$ немного больше «веса» ближе к единице, чем к нулю — при $x=1$ плотность $f_X(1) = 1{,}5$, а при $x=0$ плотность $f_X(0)=0{,}5$, то есть втрое меньше. Это разумно: совместная плотность $f(x,y)=x+y$ больше в углу $(1,1)$ и меньше в углу $(0,0)$, а значит и большие значения $X$ (усреднённые по всем $Y$) должны быть немного более вероятны, чем маленькие.
Пример 3 (сложный). Вернёмся к треугольнику $\{x\ge0,\ y\ge0,\ x+y\le1\}$ с равномерной плотностью $f(x,y)=2$. Найдём маргинальную плотность $Y$. Для фиксированного $y \in [0,1]$ переменная $x$ пробегает от $0$ до $1-y$ (это следует из ограничения $x \le 1-y$):
$$f_Y(y) = \int_0^{1-y} 2\, dx = 2(1-y), \qquad y \in [0,1].$$Проверка нормировки: $\displaystyle\int_0^1 2(1-y)\, dy = 2\left(1 - \frac12\right) = 1$ ✓. Интересная деталь: несмотря на то что совместное распределение выглядело «симметрично простым» — константа $2$ на треугольнике, — маргинальное распределение $Y$ оказалось не равномерным: $f_Y(0) = 2$, а $f_Y(1) = 0$. Это значит, что маленькие значения $Y$ (близкие к нулю) встречаются в четыре раза чаще, чем значения около $0{,}5$ (там $f_Y(0{,}5)=1$), и намного чаще, чем значения около единицы. Причина чисто геометрическая: чем больше $y$, тем короче отрезок допустимых $x$ (треугольник сужается к вершине $(0,1)$), а значит тем меньше «пространства» достаётся этому значению $y$. Урок отсюда простой и важный: равномерность совместного распределения на фигуре произвольной формы вовсе не гарантирует равномерность маргинального распределения каждой координаты — форма носителя искажает частные распределения.
Почему это важно. В любом реальном датасете тебе почти никогда не выдают маргинальные распределения признаков напрямую — их приходится вычислять, агрегируя (суммируя или усредняя) по остальным столбцам. Ровно это делает df.groupby('X')['Y'].sum() в пандасе или pivot_table с параметром margins=True — тот самый исторический термин Пирсона дожил до наших дней буквально в названии параметра библиотеки для анализа данных. Когда ты строишь гистограмму одного признака, не глядя на остальные, ты фактически визуализируешь его маргинальное распределение — и должен понимать, что эта гистограмма скрывает всю информацию о связях этого признака с другими.
Условные распределения
Интуиция: то, что учится модель
Маргинальное распределение отвечает на вопрос «а что вообще происходит с $Y$, если не обращать внимания на $X$?». Но самый интересный вопрос в анализе данных обычно звучит иначе: «а что происходит с $Y$, если я знаю, что $X$ приняло конкретное значение?» Вернёмся к клиентам магазина: маргинально покупку совершают $45\%$ клиентов. Но если ты уже знаешь, что клиент подписан на рассылку ($X=1$), эта доля должна быть другой — скорее всего, выше, потому что подписка сама по себе говорит о вовлечённости. Вопрос «какова вероятность покупки при условии, что клиент подписан» — это и есть вопрос об условном распределении.
Именно эта конструкция — условное распределение целевой переменной при заданных значениях признаков — лежит в основе всего обучения с учителем. Логистическая регрессия, дерево решений, градиентный бустинг, нейросеть с сигмоидой на выходе — все они, разными способами, пытаются приблизить одну и ту же вещь: $p(y \mid x)$, распределение метки $y$ при заданном векторе признаков $x$. Регрессия предсказывает $\mathbb{E}[Y \mid X=x]$ — среднее условного распределения. Классификатор, выдающий вероятности, оценивает саму функцию $p(y \mid x)$ целиком. Понимание, что такое условное распределение на строгом языке теории вероятностей, — это, по сути, понимание того, что именно происходит «под капотом» supervised learning.
Определение: Условным распределением случайной величины $Y$ при условии $X=x$ называется распределение, полученное из совместного делением на маргинальную вероятность (плотность) события $X=x$. Для дискретного случая, при $P(X=x) > 0$:
$$P(Y=y \mid X=x) = \frac{P(X=x,\ Y=y)}{P(X=x)}.$$Для непрерывного случая, при $f_X(x) > 0$, условная плотность:
$$f(y \mid x) = \frac{f(x,y)}{f_X(x)}.$$Условное распределение — это полноценное распределение вероятностей самой по себе переменной $Y$ (или $x$): оно неотрицательно и нормируется на единицу при суммировании (интегрировании) по всем значениям $y$.
Обрати внимание на важную деталь этого определения: условное распределение $f(y \mid x)$ при фиксированном $x$ — это функция от $y$, и она обязана нормироваться в единицу: $\int f(y\mid x)\, dy = 1$ для каждого конкретного $x$. Именно эта нормировка и отличает условную плотность от совместной — совместная плотность $f(x,y)$ нормируется в единицу только при интегрировании сразу по обеим переменным, а не по одной.
Примеры с разбором
Пример 1 (лёгкий). Для таблицы клиентов магазина найдём условное распределение $Y$ при условии, что клиент подписан на рассылку, то есть $P(Y \mid X=1)$. Из маргинального распределения мы уже знаем $P(X=1) = 0{,}40$. Делим совместные вероятности из строки $X=1$ на это число:
$$P(Y=0 \mid X=1) = \frac{P(X=1,Y=0)}{P(X=1)} = \frac{0{,}10}{0{,}40} = 0{,}25, \qquad P(Y=1 \mid X=1) = \frac{P(X=1,Y=1)}{P(X=1)} = \frac{0{,}30}{0{,}40} = 0{,}75.$$Проверим нормировку: $0{,}25+0{,}75 = 1$ ✓. Для сравнения найдём условное распределение $Y$ при условии, что подписки нет, $X=0$: $P(Y=1\mid X=0) = \dfrac{0{,}15}{0{,}60} = 0{,}25$. Разница разительная: среди подписанных клиентов покупку совершают $75\%$, среди неподписанных — только $25\%$. Маргинально доля покупателей была $45\%$ — некое «среднее по больнице», за которым скрывались две очень разные группы. Вот именно ради такого различения условное распределение и существует.
Пример 2 (средний). Для совместной плотности $f(x,y)=x+y$ на $[0,1]^2$ найдём условную плотность $f(y \mid x)$ и условное математическое ожидание $\mathbb{E}[Y \mid X=x]$. Мы уже знаем маргинальную плотность $f_X(x) = x + \tfrac12$. По определению:
$$f(y\mid x) = \frac{f(x,y)}{f_X(x)} = \frac{x+y}{x+\frac12}, \qquad y \in [0,1].$$Найдём условное математическое ожидание при фиксированном $x$:
$$\mathbb{E}[Y \mid X=x] = \int_0^1 y \cdot f(y\mid x)\, dy = \frac{1}{x+\frac12}\int_0^1 y(x+y)\, dy = \frac{1}{x+\frac12}\left[\frac{xy^2}{2}+\frac{y^3}{3}\right]_0^1 = \frac{\frac{x}{2}+\frac{1}{3}}{x+\frac12}.$$Подставим два конкретных значения. При $x=0$: $\mathbb{E}[Y\mid X=0] = \dfrac{0+\frac13}{\frac12} = \dfrac{1/3}{1/2} = \dfrac23 \approx 0{,}667$. При $x=1$: $\mathbb{E}[Y\mid X=1] = \dfrac{\frac12+\frac13}{\frac32} = \dfrac{5/6}{3/2} = \dfrac{5}{9} \approx 0{,}556$. Интересно: условное среднее $Y$ убывает с ростом $x$ — при малых значениях $X$ переменная $Y$ в среднем больше, а при $X$, близком к единице, $Y$ в среднем чуть меньше. Это может показаться странным (ведь плотность больше в углу, где обе координаты велики), но объясняется формой знаменателя: при больших $x$ маргинальная плотность $f_X(x)$ и так уже «набрала вес» за счёт больших $x$, и условная плотность $y$ становится более равномерной относительно того, какой вклад в неё вносит именно $y$.
Пример 3 (сложный). В треугольнике $\{x\ge0,\ y\ge0,\ x+y\le1\}$ с плотностью $f(x,y)=2$ найдём условную плотность $f(x \mid y)$ и опиши её словами. Мы уже нашли маргинальную плотность $f_Y(y) = 2(1-y)$. Тогда:
$$f(x\mid y) = \frac{f(x,y)}{f_Y(y)} = \frac{2}{2(1-y)} = \frac{1}{1-y}, \qquad x \in [0,\ 1-y].$$Это плотность равномерного распределения на отрезке $[0,\ 1-y]$ — константа $\dfrac{1}{1-y}$ на этом отрезке, что в точности равно $\dfrac{1}{\text{длина отрезка}}$. Результат чрезвычайно красивый и полезный для интуиции: при фиксированном $Y=y$ переменная $X$ «не знает» ничего, кроме того, что её носитель ограничен отрезком $[0, 1-y]$ — внутри этого отрезка все значения $X$ равновероятны. Условное математическое ожидание сразу очевидно из свойств равномерного распределения: $\mathbb{E}[X\mid Y=y] = \dfrac{0+(1-y)}{2} = \dfrac{1-y}{2}$. Проверим на границах: при $y=0$ получаем $\mathbb{E}[X\mid Y=0]=\tfrac12$ (треугольник в этом сечении — весь отрезок $[0,1]$, и среднее действительно посередине); при $y \to 1$ получаем $\mathbb{E}[X\mid Y=1]\to 0$ (в самой вершине треугольника отрезок для $X$ стягивается в точку $\{0\}$).
Почему это важно. Когда ты обучаешь модель бинарной классификации оттока клиентов и видишь на выходе число $0{,}82$ для конкретного клиента, это число — точечная оценка условной вероятности $P(Y=1 \mid X=x)$, где $x$ — вектор признаков именно этого клиента. Модель не пытается выучить одно число «доля оттока по всей базе» (это была бы маргинальная вероятность, скучная и почти бесполезная константа) — она пытается выучить целую функцию от $x$, показывающую, как условная вероятность оттока меняется в зависимости от признаков. Ошибка, которую совершают многие новички: путают маргинальную (базовую) вероятность класса — например «отток случается в $12\%$ случаев по всей базе» — с условной вероятностью, которую выдаёт модель для конкретного объекта. Это фундаментально разные числа, и разница между ними — это именно та информация, которую несут признаки.
Независимость случайных величин в терминах совместного распределения
Интуиция: когда знание об одном ничего не говорит о другом
Ты уже встречал понятие независимости событий в уроке 229 — там события $A$ и $B$ независимы, если $P(A \cap B) = P(A) \cdot P(B)$. Для случайных величин идея ровно та же, только применённая ко всем возможным событиям вида «$X$ попало в такой-то диапазон» и «$Y$ попало в такой-то диапазон» одновременно. Интуитивно: $X$ и $Y$ независимы, если знание значения одной величины никак не меняет распределение другой. В терминах условного распределения из предыдущего раздела это можно сформулировать очень прямо: $X$ и $Y$ независимы, если условное распределение $Y$ при любом условии $X=x$ совпадает с безусловным, маргинальным распределением $Y$. Другими словами — «забывание про $X$» ничего не меняет, потому что $X$ и так ничего не говорило про $Y$.
Есть очень удобный практический признак, к которому эта интуиция сводится алгебраически: совместная плотность (или совместная вероятность в дискретном случае) должна факторизоваться — раскладываться в произведение двух функций, каждая из которых зависит только от одной переменной.
Определение: Случайные величины $X$ и $Y$ называются независимыми, если их совместная функция распределения равна произведению маргинальных функций распределения для любых $x, y$:
$$F(x,y) = F_X(x) \cdot F_Y(y).$$Эквивалентно, для дискретного случая — если совместная вероятность равна произведению маргинальных для всех пар значений:
$$P(X=x,\ Y=y) = P(X=x)\cdot P(Y=y) \quad \text{для всех } x, y.$$Для непрерывного случая с совместной плотностью — если совместная плотность равна произведению маргинальных плотностей:
$$f(x,y) = f_X(x) \cdot f_Y(y) \quad \text{для почти всех } x, y.$$
Обрати внимание на важную тонкость: равенство должно выполняться для всех пар значений, а не для какой-то одной удачной пары. Если оно нарушается хотя бы в одной точке — величины уже зависимы. И второе важное наблюдение, которое часто упускают: если носитель совместного распределения (область, где $f(x,y) > 0$) не является прямоугольником (или, точнее, произведением двух множеств — одного для $x$, другого для $y$), то независимости быть не может в принципе, даже не нужно ничего вычислять. Мы это уже видели на примере треугольника выше: там сам факт, что диапазон $X$ зависит от значения $Y$ (при $y$ близком к единице $X$ вынужден быть маленьким), геометрически означает зависимость ещё до какой-либо алгебры.
Примеры с разбором
Пример 1 (лёгкий). Проверим независимость для таблицы клиентов магазина. Мы уже знаем: $P(X=1)=0{,}40$, $P(Y=1)=0{,}45$. Если бы $X$ и $Y$ были независимы, должно было бы выполняться $P(X=1,Y=1) = P(X=1)\cdot P(Y=1) = 0{,}40 \cdot 0{,}45 = 0{,}18$. Но по таблице реальное значение $P(X=1,Y=1)=0{,}30$. Поскольку $0{,}30 \ne 0{,}18$, величины зависимы — и это ровно то, что мы и предполагали интуитивно: подписка на рассылку связана с вероятностью покупки.
Пример 2 (средний). Рассмотрим равномерное распределение на прямоугольнике $[0,2]\times[0,3]$: плотность $f(x,y) = c$ — константа на прямоугольнике. Из условия нормировки $c \cdot 2 \cdot 3 = 1$ находим $c = \tfrac16$. Найдём маргинальные плотности: $f_X(x) = \displaystyle\int_0^3 \frac16\, dy = \frac{3}{6}=\frac12$ на $[0,2]$, и $f_Y(y) = \displaystyle\int_0^2 \frac16\, dx = \frac{2}{6}=\frac13$ на $[0,3]$. Проверим факторизацию: $f_X(x)\cdot f_Y(y) = \dfrac12 \cdot \dfrac13 = \dfrac16 = f(x,y)$ — совпадает при всех $(x,y)$ внутри прямоугольника! Значит, $X$ и $Y$ независимы, причём $X \sim U(0,2)$, а $Y \sim U(0,3)$ по отдельности. Это общий факт, который стоит запомнить: равномерное распределение на прямоугольнике (или, в общем случае, на прямоугольном параллелепипеде в многомерном пространстве) всегда даёт независимые координаты, а равномерное распределение на любой другой фигуре (треугольник, круг, эллипс) — почти никогда.
Пример 3 (сложный). Совместная функция распределения задана как $F(x,y) = \left(1-e^{-2x}\right)\left(1-e^{-3y}\right)$ для $x,y \ge 0$. Найдём совместную плотность и проверим независимость, а заодно определим маргинальные распределения. Дифференцируем дважды:
$$f(x,y) = \frac{\partial^2 F}{\partial x\, \partial y} = \frac{\partial}{\partial x}\left[\left(1-e^{-2x}\right)\cdot 3e^{-3y}\right] = 2e^{-2x} \cdot 3e^{-3y} = 6\, e^{-2x-3y}, \qquad x,y \ge 0.$$Плотность уже сама по себе выглядит как произведение — $6e^{-2x-3y} = \left(2e^{-2x}\right)\cdot\left(3e^{-3y}\right)$. Обозначим $g(x) = 2e^{-2x}$ и $h(y) = 3e^{-3y}$: это в точности плотности показательного распределения с параметрами $\lambda=2$ и $\lambda=3$ соответственно (проверь нормировку: $\int_0^\infty 2e^{-2x}dx = 1$ и $\int_0^\infty 3e^{-3y}dy=1$ — обе выполнены). Значит, $f(x,y)=g(x)h(y)$, и по определению $X$ и $Y$ независимы, причём $X \sim \mathrm{Exp}(2)$, $Y \sim \mathrm{Exp}(3)$. Это стандартная конструкция: если тебе изначально задают совместную функцию распределения как произведение двух одномерных функций распределения, независимость гарантирована по построению — задачи такого типа проверяют не вычислительные навыки, а то, узнаёшь ли ты факторизованную структуру с первого взгляда.
Почему это важно. Независимость в терминах факторизации плотности — это не абстрактная формальность, а рабочий инструмент, встроенный в самые популярные алгоритмы машинного обучения. Наивный байесовский классификатор целиком построен на (наивном, отсюда и название) предположении, что признаки условно независимы при известном классе: $p(x_1, x_2, \dots, x_n \mid y) = \prod_{i=1}^n p(x_i \mid y)$. Это позволяет оценить совместную условную плотность по $n$ признакам, вообще не оценивая совместное распределение напрямую (что потребовало бы экспоненциально много данных) — достаточно оценить $n$ одномерных условных распределений и перемножить. Когда это предположение выполняется хотя бы приближённо, наивный байес работает на удивление хорошо даже с очень небольшим количеством данных; когда признаки сильно взаимосвязаны, метод систематически ошибается, потому что перемножение «одинарных» вкладов переоценивает или недооценивает совместный эффект.
Практика: 30 заданий
Базовые (задания 1–10)
Задание 1. Дискретный случайный вектор $(X,Y)$ задан совместной таблицей: $P(X=0,Y=1)=0{,}10$, $P(X=0,Y=2)=0{,}20$, $P(X=0,Y=3)=0{,}10$, $P(X=1,Y=1)=0{,}15$, $P(X=1,Y=2)=0{,}25$, $P(X=1,Y=3)=0{,}20$. Проверь, что это корректное совместное распределение, и найди маргинальные распределения $X$ и $Y$.
Задание 2. Для таблицы из задания 1 проверь, независимы ли $X$ и $Y$.
Задание 3. Для таблицы из задания 1 найди условное распределение $Y$ при условии $X=0$.
Задание 4. Совместная плотность $(X,Y)$ равна $f(x,y)=c$ на прямоугольнике $0\le x\le 2$, $0\le y\le 3$, и нулю вне него. Найди константу $c$.
Задание 5. Для плотности из задания 4 найди маргинальную плотность $f_X(x)$ и проверь её нормировку.
Задание 6. Для плотности из задания 4 проверь, независимы ли $X$ и $Y$.
Задание 7. Для совместного распределения из задания 1 найди совместную функцию распределения в точке $F(0{,}5;\ 2)$.
Задание 8. В датасете кредитного скоринга случайный вектор состоит из категориального признака $X$ (рейтинг клиента: низкий, средний, высокий) и бинарной метки $Y$ (дефолт: 0 — нет, 1 — да). Опиши словами, что представляет собой строка такого датасета как случайный вектор, и почему нельзя ограничиться только маргинальным распределением $Y$ при построении модели.
Задание 9. Кубик и монета бросаются одновременно и независимо. $X$ — число очков на кубике (от 1 до 6), $Y$ — индикатор орла на монете ($Y=1$, если орёл, иначе $0$). Найди совместную вероятность $P(X=6, Y=1)$, опираясь на независимость.
Задание 10. Дискретный случайный вектор $(X,Y)$, где $X,Y \in \{1,2,3\}$, задан таблицей: диагональные значения $P(X=i,Y=i)=0{,}20$ для каждого $i=1,2,3$, а все остальные (недиагональные) шесть комбинаций равновероятны между собой. Зная, что сумма всех вероятностей равна единице, найди вероятность каждой недиагональной комбинации и маргинальное распределение $X$.
Средние (задания 11–20)
Задание 11. Совместная плотность $(X,Y)$ равна $f(x,y)=x+y$ на квадрате $[0,1]\times[0,1]$. Найди $P(X>Y)$.
Задание 12. Для плотности $f(x,y)=x+y$ на $[0,1]^2$ найди $\mathbb{E}[Y\mid X=0]$ и $\mathbb{E}[Y\mid X=1]$, используя условную плотность $f(y\mid x) = \dfrac{x+y}{x+\frac12}$.
Задание 13. Проверь, независимы ли $X$ и $Y$ с плотностью $f(x,y)=x+y$ на $[0,1]^2$, сравнив $f(x,y)$ с произведением маргинальных плотностей в точке $(0,0)$.
Задание 14. Случайный вектор $(X,Y)$ равномерно распределён внутри треугольника с вершинами $(0,0)$, $(1,0)$, $(0,1)$. Найди совместную плотность и маргинальную плотность $f_X(x)$.
Задание 15. Для того же треугольника найди условную плотность $f(x\mid y)$ и опиши, какое известное распределение она задаёт.
Задание 16. Не проводя вычислений с плотностью, объясни, почему $X$ и $Y$ из задания 14 обязаны быть зависимыми — используя только геометрическую форму носителя.
Задание 17. Наивный байесовский классификатор предполагает условную независимость двух признаков $X_1, X_2$ при известном классе $Y$: $p(x_1,x_2\mid y) = p(x_1\mid y)\cdot p(x_2\mid y)$. Дано: $p(x_1=1\mid y=1)=0{,}8$, $p(x_2=1\mid y=1)=0{,}6$. Найди $p(x_1=1, x_2=1\mid y=1)$.
Задание 18. Совместная функция распределения задана как $F(x,y) = (1-e^{-2x})(1-e^{-3y})$ при $x,y\ge0$. Найди совместную плотность и определи, какие распределения имеют $X$ и $Y$ по отдельности.
Задание 19. Для равномерного распределения на прямоугольнике $[0,2]\times[0,3]$ (плотность $f(x,y)=\tfrac16$) найди совместную функцию распределения $F(x,y)$ внутри прямоугольника и вычисли $F(1,2)$.
Задание 20. Пользуясь $F(x,y)=\dfrac{xy}{6}$ из задания 19, найди $P(0{,}5 < X \le 1{,\!}5,\ 1 < Y \le 2)$ через формулу включения-исключения для прямоугольной области.
Продвинутые (задания 21–30)
Задание 21. Независимые случайные величины $X,Y\sim\mathrm{Exp}(1)$, совместная плотность $f(x,y)=e^{-x-y}$ при $x,y\ge0$. Найди $P(X+Y>2)$.
Задание 22. Для равномерного распределения в треугольнике с вершинами $(0,0)$, $(1,0)$, $(0,1)$ (плотность $f(x,y)=2$) найди математическое ожидание $\mathbb{E}[X]$.
Задание 23. Двумерная нормальная плотность с параметрами $\mu_X=10,\ \mu_Y=20,\ \sigma_X=2,\ \sigma_Y=5,\ \rho=0{,}6$ задаёт условное распределение $Y\mid X=x$, которое тоже нормально, со средним $\mathbb{E}[Y\mid X=x] = \mu_Y+\rho\dfrac{\sigma_Y}{\sigma_X}(x-\mu_X)$ и дисперсией $\mathbb{D}[Y\mid X=x]=\sigma_Y^2(1-\rho^2)$. Найди условное среднее и условную дисперсию $Y$ при $X=13$.
Задание 24. В задаче медицинской диагностики $Y\in\{0,1\}$ — наличие заболевания, $X_1, X_2$ — результаты двух независимых при известном $Y$ анализов. Известно: $p(y=1)=0{,}05$, $p(x_1=1\mid y=1)=0{,}9$, $p(x_2=1\mid y=1)=0{,}85$, $p(x_1=1\mid y=0)=0{,}1$, $p(x_2=1\mid y=0)=0{,}05$. Найди $p(y=1\mid x_1=1,x_2=1)$ по теореме Байеса, используя условную независимость $X_1,X_2$ при заданном $Y$.
Задание 25. Совместная функция распределения задана как $F(x,y) = \min(F_X(x),\ F_Y(y))$, где $F_X, F_Y$ — произвольные одномерные функции распределения. Такое $F$ описывает предельный случай полной положительной зависимости ($X$ и $Y$ — монотонные функции друг друга, в частности при одинаковых $F_X=F_Y$ выполняется $X=Y$ почти наверное). Проверь, может ли такая $F$ факторизоваться в произведение $F_X(x)\cdot F_Y(y)$ при $F_X=F_Y$, кроме тривиальных случаев.
Задание 26. A/B-тест: $X$ — индикатор группы ($X=0$ — контроль с вероятностью $0{,}6$, $X=1$ — тест с вероятностью $0{,}4$). Время на сайте $Y$ имеет условное распределение $Y\mid X{=}0 \sim \mathrm{Exp}(1)$, $Y\mid X{=}1 \sim \mathrm{Exp}(0{,}5)$. Найди маргинальную плотность $f_Y(1)$ и безусловное математическое ожидание $\mathbb{E}[Y]$.
Задание 27. Независимые $X\sim U(0,1)$ и $Y\sim U(0,2)$. Найди $P(X Задание 28. Три сервера отвечают на запрос с независимыми временами отклика $X_1,X_2,X_3 \sim \mathrm{Exp}(0{,}5)$ (одинаковое распределение, но не важно какое конкретно, важна только независимость и одинаковость). Найди вероятность того, что именно первый сервер ответит быстрее двух других, то есть $P(X_1 = \min(X_1,X_2,X_3))$. Задание 29. Случайный вектор $(X,Y,Z)$ равномерно распределён на прямоугольном параллелепипеде $[0,2]\times[0,3]\times[0,5]$. Найди совместную плотность и проверь независимость всех трёх координат. Задание 30. Датасет кредитного скоринга задан совместным распределением рейтинга $X\in\{\text{низкий, средний, высокий}\}$ и дефолта $Y\in\{0,1\}$: $P(X{=}\text{низкий},Y{=}1)=0{,}15$, $P(X{=}\text{низкий},Y{=}0)=0{,}05$, $P(X{=}\text{средний},Y{=}1)=0{,}15$, $P(X{=}\text{средний},Y{=}0)=0{,}25$, $P(X{=}\text{высокий},Y{=}1)=0{,}05$, $P(X{=}\text{высокий},Y{=}0)=0{,}35$. Найди условное распределение $P(Y{=}1\mid X)$ для всех трёх рейтингов и объясни, почему именно эту функцию учит модель классификации. ❌ Ошибка: «Если известны распределения $X$ и $Y$ по отдельности, совместное распределение можно однозначно восстановить»
✅ Правильно: По двум маргинальным распределениям совместное распределение восстановить нельзя — одна и та же пара маргинальных плотностей совместима с бесконечным числом разных совместных плотностей (от полной независимости до полной зависимости)
💡 Почему: Маргинализация — это операция, которая теряет информацию: она суммирует (интегрирует) по одной из переменных, стирая всё, что касалось их совместного поведения. Восстановить стёртое из одних только сумм по строкам и столбцам таблицы невозможно. ❌ Ошибка: «Если $X$ и $Y$ независимы, то совместная плотность равна сумме маргинальных: $f(x,y)=f_X(x)+f_Y(y)$»
✅ Правильно: $f(x,y) = f_X(x)\cdot f_Y(y)$ — плотности перемножаются, а не складываются
💡 Почему: Складывать плотности даже размерно неверно: сумма двух плотностей не будет нормироваться в единицу при интегрировании по обеим переменным. Правильная аналогия — независимость событий $P(A\cap B)=P(A)P(B)$, а не сложение. ❌ Ошибка: «Условная плотность $f(y\mid x)$ — это то же самое, что совместная плотность $f(x,y)$, просто записанная по-другому»
✅ Правильно: $f(y\mid x) = f(x,y)/f_X(x)$ — это совместная плотность, поделённая на маргинальную плотность $X$ в этой точке
💡 Почему: Совместная плотность нормируется в единицу при двойном интегрировании по обеим переменным сразу. Условная плотность при фиксированном $x$ обязана нормироваться в единицу сама по себе, при интегрировании только по $y$ — это разные объекты с разными единицами измерения. ❌ Ошибка: «Раз носитель совместного распределения — прямоугольник, значит величины точно независимы»
✅ Правильно: Прямоугольный носитель — необходимое, но не достаточное условие независимости; плотность внутри прямоугольника всё равно должна факторизоваться
💡 Почему: Возьми плотность $f(x,y)=x+y$ на квадрате $[0,1]^2$ — носитель прямоугольный, но плотность не факторизуется (задание 13), значит величины зависимы. Прямоугольная форма исключает независимость только в обратную сторону: если носитель НЕ прямоугольный, независимости точно нет. ❌ Ошибка: «Модель классификации выучивает вероятность класса $P(Y=1)$»
✅ Правильно: Модель выучивает условную вероятность $P(Y{=}1\mid X{=}x)$ как функцию от признаков $x$, а не одно фиксированное число
💡 Почему: Маргинальная вероятность $P(Y=1)$ — это константа, одинаковая для всех объектов, она никак не использует признаки. Прогностическая сила модели целиком заключена в том, что она выдаёт разные значения для разных $x$ — именно это и есть условное распределение. ❌ Ошибка: «Если совместная функция распределения существует, то обязательно существует и совместная плотность»
✅ Правильно: Совместная плотность существует только для абсолютно непрерывных случайных векторов; для дискретных, смешанных или векторов с сингулярной компонентой (например, $X=Y$ почти наверное) плотности в обычном смысле может не быть
💡 Почему: Плотность — это производная функции распределения, а у разрывных или «сосредоточенных на линии» распределений (как в задании 25) такая производная не определена в классическом смысле — там уже нужны более тонкие инструменты, вроде обобщённых функций или отдельного рассмотрения дискретной и непрерывной частей. ✅ Случайный вектор $(X_1,\dots,X_n)$ — несколько случайных величин на одном вероятностном пространстве, рассматриваемых совместно; строка табличного датасета — это ровно случайный вектор ✅ Совместная функция распределения: $F(x,y)=P(X\le x, Y\le y)$; совместная плотность: $f(x,y)=\partial^2F/\partial x\,\partial y$, с условием $\iint f(x,y)\,dx\,dy=1$ ✅ Маргинализация — получение распределения одной компоненты суммированием (дискретный случай) или интегрированием (непрерывный случай) по остальным: $f_X(x)=\int f(x,y)\,dy$ ✅ Слово «маргинальный» исторически происходит от полей статистических таблиц Пирсона, где записывались суммы по строкам и столбцам — это не «второстепенное», а «вынесенное на край» распределение ✅ Условная плотность: $f(y\mid x) = f(x,y)/f_X(x)$ — самостоятельное распределение $Y$ при фиксированном $X=x$, нормирующееся в единицу по $y$ при каждом фиксированном $x$ ✅ Условное распределение $p(y\mid x)$ — именно то, что приближает любая модель supervised learning: регрессия оценивает $\mathbb{E}[Y\mid X{=}x]$, классификатор оценивает саму функцию $p(y\mid x)$ ✅ Независимость: $f(x,y)=f_X(x)\cdot f_Y(y)$ для всех точек — плотности перемножаются, а не складываются, и равенство должно выполняться везде, а не в одной точке ✅ Носитель совместного распределения, не являющийся прямоугольником (произведением множеств), автоматически означает зависимость — это можно определить геометрически, без вычислений ✅ По двум маргинальным распределениям совместное распределение восстановить нельзя — маргинализация необратимо теряет информацию о связи переменных ✅ Наивный байесовский классификатор работает на предположении условной независимости признаков при известном классе: $p(x_1,\dots,x_n\mid y) = \prod_i p(x_i\mid y)$ 🔙 Откуда пришли: Из урока 234 — определение одномерной случайной величины, из уроков 235–236 — функция распределения и плотность вероятности для одной переменной, из урока 230 — условная вероятность событий (здесь та же идея применяется ко всем событиям вида «переменная попала в диапазон» сразу) 🔜 Куда идём: 🎯 В машинном обучении: Признаковое пространство — это пространство значений случайного вектора; матрица корреляций перед отбором признаков — это оценка попарной зависимости компонент; наивный байес и многие вероятностные графические модели прямо используют факторизацию совместной плотности; вся теория обобщающей способности моделей формулируется в терминах того, что обучающая и тестовая выборки — независимые реализации одного и того же совместного распределения $(\mathbf{X}, Y)$ 📌 Слово «маргинальный» в статистике не имеет ничего общего с «маргинальный» в разговорном смысле («второстепенный», «периферийный по значимости») — это буквально термин из бухгалтерии XIX века: суммы, которые писали на полях (margin) страницы с таблицей, чтобы не пересчитывать их каждый раз заново. 📌 Фрэнсис Гальтон, собирая данные о росте родителей и детей в 1880-х, заметил закономерность, которую назвал «регрессия к посредственности» (regression to mediocrity): дети очень высоких родителей в среднем чуть ниже своих родителей, а дети очень низких — чуть выше. Это явление — прямое следствие свойств условного математического ожидания при неполной корреляции, и слово «регрессия» с тех пор живёт в статистике и машинном обучении, хотя современный смысл термина («предсказание непрерывной величины») довольно далёк от изначального биологического наблюдения. 📌 Наивный байесовский классификатор, несмотря на «наивность» предположения об условной независимости признаков, до сих пор остаётся рабочей лошадкой для фильтрации спама и базовой текстовой классификации — потому что даже при нарушении предположения о независимости итоговое ранжирование объектов по вероятности класса часто остаётся почти правильным, хотя сами вероятности бывают откалиброваны плохо. 📌 Двумерное нормальное распределение — единственное классическое двумерное распределение, у которого из нулевой ковариации между компонентами следует их независимость. Для всех остальных совместных распределений это не так: нулевая линейная связь (ковариация) не гарантирует независимости, о чём подробно пойдёт речь в следующем уроке про ковариацию и корреляцию. 📌 В картах глубокого обучения совместное распределение данных и меток $p(\mathbf{x}, y)$ — это ровно то, что пытаются смоделировать генеративные модели (например, вариационные автокодировщики или диффузионные модели), в отличие от дискриминативных моделей (обычных классификаторов), которые моделируют только условное распределение $p(y\mid\mathbf{x})$ — этот водораздел («генеративный против дискриминативного подхода») целиком описывается языком совместного и условного распределений из этого урока. 💡 Прежде чем считать интеграл по сложной области, спроси себя: симметрична ли область и симметрична ли плотность относительно какой-нибудь замены переменных? Если да — как в примере с $P(X>Y)$ на симметричном треугольнике или квадрате, — ответ часто получается без единого интеграла, просто из соображений симметрии. 💡 Если тебе дали совместную функцию распределения и она сходу выглядит как произведение двух выражений, одно из которых зависит только от $x$, другое только от $y$ (как $F(x,y)=(1-e^{-2x})(1-e^{-3y})$), — не пиши сложные вычисления, чтобы «доказать» независимость: она уже гарантирована самим видом функции, и множители сразу дают маргинальные распределения. 💡 Перед тем как проверять независимость через вычисление $f_X(x)\cdot f_Y(y)$, быстро посмотри на форму носителя — прямоугольник это или нет. Если не прямоугольник (треугольник, круг, любая фигура с границами, зависящими друг от друга) — величины точно зависимы, и можно сразу дать ответ без единого интеграла. 💡 При работе с pandas в реальных датасетах команда 💡 Если нужно быстро прикинуть, различаются ли условные распределения $Y\mid X=x_1$ и $Y\mid X=x_2$ на практике (без формальных тестов), построй две отдельные гистограммы $Y$, отфильтровав данные по $X=x_1$ и по $X=x_2$ — визуальное сравнение форм этих гистограмм часто сразу подсказывает, стоит ли ожидать, что $X$ окажется полезным признаком для предсказания $Y$. 💡 Формулу полного математического ожидания $\mathbb{E}[Y] = \sum_x P(X{=}x)\cdot\mathbb{E}[Y\mid X{=}x]$ (или её интегральный аналог) удобно использовать как «читерский» способ считать безусловное среднее в задачах со смесями (как в задании 26 про A/B-тест) — не нужно заново интегрировать по маргинальной плотности, если условные средние уже известны из свойств стандартных распределений. Заверши мысленно эту картину: строка любого табличного датасета — это не набор случайно сложенных вместе чисел, а реализация единого случайного вектора с определённым совместным распределением. Маргинализация показывает тебе, что происходит с одним признаком, если забыть про остальные. Условное распределение показывает, что происходит с целевой переменной, если ты уже знаешь значения признаков, — и это ровно то, что учится внутри любой модели обучения с учителем. А проверка независимости через факторизацию плотности — это строгий язык для ответа на вопрос «а даёт ли этот признак вообще какую-то информацию». Дальше в уроке 244 ты научишься сворачивать всю эту многомерную картину в одно число — ковариацию и корреляцию, — но помни: за этим единственным числом всегда стоит именно совместное распределение, которое ты научился строить, разбирать на маргинальные и условные части и проверять на независимость именно сегодня. Попрактикуйся на задачах и получи персональные рекомендации от AI
Частые ошибки
Главное запомнить
Связь с другими темами курса
Интересные факты
Лайфхаки и полезные трюки
pd.crosstab(df['X'], df['Y'], normalize='all') строит именно совместное распределение двух категориальных признаков в долях, а параметр margins=True добавляет к этой таблице ровно те самые «краевые» (маргинальные) суммы — тот же приём, что придумал Карл Пирсон больше века назад, только теперь одной строкой кода.
Понял тему? Закрепи в боте! 🚀