Закон больших чисел 🧲
Ты обучил модель, прогнал её на тестовой выборке из 50 объектов и получил accuracy 0,94. Через неделю разметчики докинули данных, тест вырос до 5000 объектов, и ты прогнал ту же самую модель заново — ни одного изменения в весах. Accuracy оказалась 0,89. Модель за неделю не изменилась ни на бит. Изменилось только одно: сколько объектов ты успел усреднить, прежде чем поверить получившемуся числу.
Это не баг и не совпадение с разметкой. Это ровно та причина, ради которой число «accuracy» вообще имеет право на существование. На 50 объектах среднее «угадал/не угадал» — крайне шаткая оценка: она может разойтись с истинным качеством модели на 5-10 процентных пунктов просто из-за того, какие именно 50 объектов попали в тест. На 5000 объектах та же самая оценка почти не шатается — измеренное и истинное качество расходятся уже на десятые доли процента. Между этими двумя ситуациями лежит ровно одна теорема, и она называется закон больших чисел (ЗБЧ).
Смысл теоремы обманчиво прост: среднее по большому числу независимых испытаний стремится к математическому ожиданию. Кажется, что это очевидно и не требует доказательства — интуитивно ты и так в это веришь с детства, ещё с того момента, как заметил, что монета выпадает орлом примерно в половине случаев. Но «примерно верить» и «доказать строго» — разные вещи, а разница между ними стоит денег: она отвечает на вопрос, сколько тестовых объектов нужно набрать, прежде чем доверять цифре accuracy, и сколько примеров должно быть в батче, прежде чем градиент перестанет быть шумом и начнёт быть сигналом.
Сегодняшний урок — доказательный. Мы возьмём готовый инструмент из урока 238 (неравенство Чебышёва) и с его помощью строго докажем, что среднее действительно сходится к своему пределу — причём не «почти всегда на глазок», а с конкретной, вычислимой гарантией. Разберём общую форму теоремы (закон Чебышёва — для произвольных величин с ограниченной дисперсией) и её самый знаменитый частный случай (закон Бернулли — для частоты события). А в конце разберём психологическую ловушку, в которую попадает почти каждый человек, интуитивно веривший в ЗБЧ чуть сильнее, чем следовало: ошибку игрока, она же закон малых чисел — ложную уверенность, что случайность обязана «выравниваться» уже на коротких сериях.
🎯 Ты узнаешь:
- Что такое неравенство Чебышёва, как его получить из неравенства Маркова и почему оно работает для абсолютно любого распределения с конечной дисперсией
- Как звучит закон больших чисел в форме Чебышёва — для попарно независимых величин с ограниченной (но необязательно одинаковой!) дисперсией — и как из неравенства Чебышёва он доказывается в три строки
- Как звучит закон больших чисел в форме Бернулли — важнейший частный случай про сходимость частоты события к его вероятности — и почему это теоретическое обоснование того, что accuracy на тесте вообще что-то измеряет
- Чем закон больших чисел принципиально отличается от центральной предельной теоремы (урок 241): один говорит, куда сходится среднее, другая — с какой скоростью
- Что такое ошибка игрока и закон малых чисел, почему после десяти орлов подряд вероятность решки всё равно ровно 0,5, и почему абсолютная разность числа орлов и решек не сходится к нулю, а частота — сходится
- Как эти теоремы объясняют, почему оценка ошибки модели на большом тесте приближается к истинной ошибке на генеральной совокупности данных, и почему увеличение размера батча снижает шум оценки градиента
История: откуда это взялось?
Первую строгую версию закона больших чисел доказал швейцарский математик Якоб Бернулли — и заплатил за это без малого двадцатью годами жизни. Он взялся за задачу в 1690-х: интуиция подсказывала, что если бросать монету очень много раз, доля орлов должна приближаться к $1/2$, а доля выпадений любой грани кубика — к $1/6$, но превратить это ощущение в доказанную теорему оказалось на порядок сложнее, чем казалось. Бернулли называл результат «theorema aureum» — золотой теоремой, — понимая её значение задолго до того, как довёл доказательство до конца. Он не дожил до публикации: работа «Ars Conjectandi» («Искусство предположений») вышла посмертно в 1713 году, изданная племянником Николаем Бернулли. Именно в ней появилась первая формулировка того, что мы сегодня называем законом больших чисел в форме Бернулли — про частоту события в схеме независимых испытаний.
Термин «закон больших чисел» придумал не Бернулли, а французский математик Симеон Дени Пуассон — только в 1835 году, спустя более ста лет, в работе о вероятностях в уголовных и гражданских судах. Пуассон же обобщил результат Бернулли на случай, когда вероятность успеха может немного меняться от испытания к испытанию — версия, которая сегодня носит его имя. Но по-настоящему элегантное и общее доказательство дал русский математик Пафнутий Львович Чебышёв в 1867 году, в статье «О средних величинах». Его ход был методологически революционным для своего времени: вместо того чтобы доказывать теорему для каждой конкретной ситуации заново, он сначала доказал общее неравенство, работающее для любой случайной величины с конечной дисперсией — то самое неравенство Чебышёва, — а из него закон больших чисел выводится буквально в три строки, причём сразу в куда более общем виде, чем у Бернулли: величины могут быть неодинаково распределены, важна лишь ограниченность дисперсии.
Дальше эстафету приняли его ученики. Андрей Андреевич Марков в начале XX века ослабил условие независимости до попарной независимости (даже не полной!) и показал, что теорема всё равно работает. А Андрей Николаевич Колмогоров в 1930-е годы нашёл необходимые и достаточные условия для усиленного закона больших чисел — версии, утверждающей сходимость не просто «по вероятности», а почти наверное. Мы в этом уроке сосредоточимся на слабой форме закона — той самой, что доказывается через неравенство Чебышёва, — потому что именно она даёт вычислимые, конкретные гарантии, которые нужны на практике: сколько тестовых объектов набрать, какой батч выбрать, сколько замеров сделать в А/В-тесте.
Интуиция закона больших чисел и неравенство Чебышёва
Интуиция
Представь, что тебе нужно дать гарантию про разброс случайной величины, но ты не имеешь права ничего предполагать о форме её распределения — только про среднее $\mu$ и дисперсию $\sigma^2$. Ты не знаешь, нормальная она, скошенная, дискретная или вообще непонятная — знаешь только эти два числа. Можешь ли ты вообще что-то гарантировать?
Оказывается, да — и это удивительно сильный факт. Неравенство Чебышёва даёт универсальную, работающую для абсолютно любого распределения оценку: вероятность того, что случайная величина отклонится от своего среднего больше чем на $\varepsilon$, не превышает $\sigma^2/\varepsilon^2$. Не важно, что за распределение — экспоненциальное, биномиальное, смесь из пяти горбов, распределение ошибок нейросети — оценка работает всегда. Плата за такую универсальность — грубость: неравенство Чебышёва почти никогда не даёт точного ответа, оно даёт worst-case гарантию, которая часто в разы хуже, чем истинная вероятность. Но в отличие от центральной предельной теоремы (урок 241), ему не нужно, чтобы $n$ было большим и распределение — «почти нормальным». Оно работает при любом $n$, точно, без асимптотики.
Получить его можно из ещё более простого факта — неравенства Маркова: для неотрицательной случайной величины $Y$ с конечным математическим ожиданием и любого $a>0$ верно $P(Y \ge a) \le \mathbb{E}Y/a$. Применим его к $Y = (X-\mu)^2$ и $a = \varepsilon^2$:
$$P\big((X-\mu)^2 \ge \varepsilon^2\big) \le \frac{\mathbb{E}(X-\mu)^2}{\varepsilon^2} = \frac{\sigma^2}{\varepsilon^2}$$Событие $(X-\mu)^2 \ge \varepsilon^2$ — это ровно событие $|X-\mu| \ge \varepsilon$ (обе части неотрицательны, извлечение корня сохраняет неравенство). Получаем готовый результат.
Теорема (неравенство Чебышёва): Пусть случайная величина $X$ имеет конечное математическое ожидание $\mathbb{E}X = \mu$ и конечную дисперсию $\mathbb{D}X = \sigma^2$. Тогда для любого $\varepsilon > 0$:
$$P(|X - \mu| \ge \varepsilon) \le \frac{\sigma^2}{\varepsilon^2}$$Эквивалентная форма через число сигм ($\varepsilon = k\sigma$): $P(|X-\mu| \ge k\sigma) \le 1/k^2$.
Примеры с разбором
Пример 1 (простой): $X$ имеет $\mu = 10$, $\sigma^2 = 4$. Оцени сверху $P(|X-10| \ge 6)$
Решение. Подставляем прямо в формулу: $\sigma^2/\varepsilon^2 = 4/36 = 1/9 \approx 0{,}111$.
Ответ: $P(|X-10|\ge 6) \le 1/9 \approx 0{,}111$ — какой бы ни была форма распределения $X$, вероятность такого отклонения не больше 11%.
Пример 2 (средний): шум градиента при разном размере батча
При обучении нейросети вклад одного объекта в оценку градиента по одной координате — случайная величина с дисперсией $\sigma^2 = 25$ (условные единицы, характерные для данного слоя). При усреднении по батчу размера $n$ дисперсия усреднённого градиента равна $\sigma^2/n$ — та же логика, что у стандартной ошибки из урока 241. Оцени вероятность того, что усреднённая по батчу оценка градиента отклонится от истинного (по всему датасету) градиента больше чем на $\varepsilon = 1$, для батча $n=100$ и для батча $n=400$.
Решение. Дисперсия усреднённого градиента при $n=100$: $25/100 = 0{,}25$. По Чебышёву: $P(|\hat g - g| \ge 1) \le 0{,}25/1^2 = 0{,}25$.
При $n=400$: дисперсия $25/400 = 0{,}0625$, бound $= 0{,}0625$.
Ответ: при батче 100 гарантия — не более 25% шанса на такое отклонение, при батче 400 — не более 6,25%. Учетверение батча ровно вчетверо уменьшило верхнюю границу вероятности «плохого» градиента — прямая иллюстрация того, зачем в глубоком обучении вообще увеличивают batch size: не чтобы ускорить одну эпоху, а чтобы уменьшить шум в каждой оценке градиента.
Пример 3 (сложный): сколько нужно тестовых объектов, и почему Чебышёв здесь избыточно осторожен
Ты оцениваешь accuracy классификатора на тесте. Заранее неизвестно истинное $p$, но известно, что дисперсия индикатора «угадал/не угадал» никогда не превышает $0{,}25$ (максимум $p(1-p)$ достигается при $p=0{,}5$). Найди минимальный размер теста $n$, чтобы неравенство Чебышёва гарантировало $P(|\hat p - p| \ge 0{,}02) \le 0{,}05$. Сравни с оценкой через ЦПТ из урока 241.
Решение. Из неравенства Чебышёва: $\sigma^2/(n\varepsilon^2) \le 0{,}05$, откуда
$$n \ge \frac{\sigma^2}{\varepsilon^2 \cdot 0{,}05} = \frac{0{,}25}{0{,}0004 \cdot 0{,}05} = \frac{0{,}25}{0{,}00002} = 12\,500$$Через ЦПТ (используем $z_{0{,}95} = 1{,}96$, худший случай $\sigma = 0{,}5$): $n \ge (1{,}96 \cdot 0{,}5/0{,}02)^2 = 49^2 = 2401$.
Ответ: неравенство Чебышёва требует минимум 12 500 объектов, ЦПТ обещает ту же самую гарантию уже при 2401 — почти в 5,2 раза меньше. Разница не случайна: Чебышёв не имеет права предполагать, что распределение среднего уже «почти нормальное», и вынужден страховаться от любого сценария, в то время как ЦПТ пользуется тем, что при большом $n$ форма распределения фактически известна.
Почему это важно
Неравенство Чебышёва — не финальный практический инструмент (для практики точнее и удобнее ЦПТ), а строительный блок для доказательства. Его сила именно в универсальности: оно не требует знать форму распределения, требует лишь конечности дисперсии. Это ровно то, что нужно, чтобы доказать закон больших чисел для произвольных независимых случайных величин — необязательно нормальных, необязательно даже одинаково распределённых. Дальше мы построим на нём весь остальной урок: и закон Чебышёва, и закон Бернулли — это два применения одного и того же неравенства к разным ситуациям.
Закон больших чисел в форме Чебышёва
Интуиция
Возьмём страховую компанию. Она не может предсказать, попадёт ли конкретный клиент в ДТП в этом году — для одного человека это почти монетка. Но если клиентов миллион, компания может почти точно предсказать долю тех, кто попадёт в ДТП, и с этой долей точно посчитать тарифы. Ключевое слово — «почти точно»: индивидуальный разброс никуда не делся, а вот разброс среднего по миллиону клиентов схлопнулся почти в точку.
То же самое происходит с оценкой ошибки модели на тесте: одно предсказание может быть верным или неверным — почти монетка. Но среднее по тысячам предсказаний куда стабильнее любого отдельного исхода. Закон больших чисел в форме Чебышёва — это точная формулировка данного факта, причём в самом общем виде: величинам не обязательно быть одинаково распределёнными, достаточно, чтобы их дисперсии были ограничены одной константой, а сами они — хотя бы попарно независимы.
Теорема (закон больших чисел в форме Чебышёва): Пусть $X_1, X_2, \dots, X_n, \dots$ — попарно независимые случайные величины, дисперсии которых ограничены одной и той же константой: $\mathbb{D}X_i \le C$ для всех $i$. Пусть $\overline X_n = \frac{1}{n}(X_1+\dots+X_n)$. Тогда для любого $\varepsilon > 0$:
$$\lim_{n\to\infty} P\big(|\overline X_n - \mathbb{E}\overline X_n| < \varepsilon\big) = 1$$
Доказательство укладывается в три шага и целиком опирается на предыдущий раздел. Обозначим $\mu_n = \mathbb{E}\overline X_n = \frac{1}{n}\sum \mathbb{E}X_i$ (у величин могут быть разные средние — теорема это допускает). Найдём дисперсию среднего, используя, что для попарно независимых (а значит, некоррелированных) величин дисперсия суммы равна сумме дисперсий:
$$\mathbb{D}\overline X_n = \frac{1}{n^2}\sum_{i=1}^{n}\mathbb{D}X_i \le \frac{1}{n^2}\cdot nC = \frac{C}{n} \xrightarrow[n\to\infty]{} 0$$Применяем неравенство Чебышёва к $\overline X_n$:
$$P(|\overline X_n - \mu_n| \ge \varepsilon) \le \frac{\mathbb{D}\overline X_n}{\varepsilon^2} \le \frac{C}{n\varepsilon^2} \xrightarrow[n\to\infty]{} 0$$Значит, $P(|\overline X_n - \mu_n| < \varepsilon) \to 1$, что и требовалось. Если дополнительно величины одинаково распределены (iid, частный, самый популярный случай), то $\mu_n = \mu$ фиксировано для всех $n$, и теорема принимает знакомую форму «$\overline X_n$ сходится по вероятности к $\mu$» — это и есть та самая сходимость по вероятности, обозначаемая $\overline X_n \xrightarrow{P} \mu$.
Примеры с разбором
Пример 1 (простой): среднее по броскам кубика
Кубик бросают $n$ раз, $\sigma^2 = 35/12 \approx 2{,}9167$ (посчитано ещё в уроке 241). Оцени по Чебышёву $P(|\overline X_n - 3{,}5| \ge 0{,}1)$ при $n = 1000$ и при $n = 100\,000$.
Решение. При $n=1000$: $\text{bound} = 2{,}9167/(1000 \cdot 0{,}01) = 2{,}9167/10 \approx 0{,}2917$.
При $n=100\,000$: $\text{bound} = 2{,}9167/(100\,000\cdot 0{,}01) = 2{,}9167/1000 \approx 0{,}0029$.
Ответ: при тысяче бросков гарантия слабая (до 29% шанса на отклонение), при ста тысячах — уже надёжная (менее 0,3%). Заметь: сама теорема лишь утверждает, что предел равен нулю при $n\to\infty$ — конкретные цифры даёт именно неравенство Чебышёва, применённое на конкретном $n$.
Пример 2 (средний): нужный размер батча для надёжной оценки градиента
Вернёмся к примеру из прошлого раздела: дисперсия вклада одного объекта в градиент $\sigma^2 = 16$. Найди минимальный размер батча $B$, при котором Чебышёв гарантирует $P(|\hat g - g| \ge 0{,}5) \le 0{,}01$.
Решение.
$$B \ge \frac{\sigma^2}{\varepsilon^2 \cdot \alpha} = \frac{16}{0{,}25 \cdot 0{,}01} = \frac{16}{0{,}0025} = 6400$$Ответ: формально, по (заведомо консервативной) гарантии Чебышёва, нужен батч из 6400 примеров. На практике таких батчей почти никто не использует — потому что на деле распределение оценки градиента куда ближе к нормальному (тот же переход, что и в примере с тестовой выборкой: ЦПТ даёт заметно менее консервативную оценку). Но качественный вывод остаётся верным при любом инструменте измерения: чем больше батч, тем меньше дисперсия оценки градиента, и именно ЗБЧ гарантирует, что при $B\to\infty$ эта оценка сойдётся к истинному градиенту по всему датасету — это и есть теоретическая основа того самого практического наблюдения, что маленькие батчи «трясут» обучение сильнее больших.
Пример 3 (сложный): тест собран из разных источников данных
Ты оцениваешь качество рекомендательной системы на тесте из $n=2000$ пользователей, собранных из трёх разных источников (веб, мобильное приложение, партнёрская интеграция). Пользователи из разных источников ведут себя по-разному, поэтому величины $X_i$ (ошибка на пользователе $i$) не одинаково распределены — но известно, что дисперсия ошибки для любого пользователя не превышает $C=4$ (метрика ограничена и клиппится). Оцени по Чебышёву гарантию $P(|\overline X_{2000} - \mu_{2000}| \ge 0{,}05)$, где $\mu_{2000}$ — среднее истинных ожидаемых ошибок по всем 2000 пользователям. Как изменится гарантия, если тест вырастет до 10 000 пользователей?
Решение. При $n=2000$: $\text{bound} = 4/(2000\cdot 0{,}0025) = 4/5 = 0{,}8$.
При $n=10\,000$: $\text{bound} = 4/(10\,000\cdot 0{,}0025) = 4/25 = 0{,}16$.
Ответ: при 2000 пользователях гарантия почти бесполезна (до 80%), при 10 000 — уже приемлема (до 16%). Важный методический момент: теорема сработала, несмотря на то что пользователи из разных источников совершенно не обязаны быть одинаково распределены — нужна лишь ограниченность дисперсии и независимость. Именно поэтому закон Чебышёва, а не более узкий вариант для iid-величин, — правильный теоретический фундамент для реальных, неоднородных тестовых выборок.
Почему это важно
Вот прямая формулировка того, зачем всё это нужно в машинном обучении: для фиксированной обученной модели измеренная ошибка на тесте — это среднее по $n$ независимым слагаемым (по одному на объект теста). Закон больших чисел в форме Чебышёва гарантирует, что при росте размера теста это среднее сходится по вероятности к истинному матожиданию ошибки — то есть к риску модели на всём распределении данных, из которого тест берётся. Это не эвристика и не «здравый смысл дата-сайентиста», это доказанная теорема, и она же объясняет, почему нельзя доверять accuracy, посчитанной на пяти объектах, но можно — посчитанной на пяти тысячах.
Ровно та же логика работает для градиента: мини-батч-SGD усредняет градиенты по объектам батча, оценивая истинный (ожидаемый по всему распределению данных) градиент. Закон больших чисел гарантирует сходимость этой оценки при росте batch size, а конкретная скорость убывания дисперсии ($C/B$) объясняет наблюдаемый на практике эффект: маленькие батчи дают шумный, дёргающийся градиент, большие — гладкий и стабильный, за счёт бо́льших вычислительных затрат на шаг.
Закон больших чисел в форме Бернулли
Интуиция
Это самый узнаваемый частный случай ЗБЧ — тот, с которого всё началось у Якоба Бернулли. Возьми любое событие $A$ с вероятностью $p$ — «монета выпала орлом», «модель угадала», «пользователь кликнул на баннер». Проведи $n$ независимых испытаний и посчитай, в какой доле из них событие произошло — это относительная частота $W_n = m/n$, где $m$ — число успехов. Интуиция подсказывает: чем больше $n$, тем точнее $W_n$ приближает $p$. Закон Бернулли делает это строгим.
Фокус в том, что доказывать теорему заново не нужно — закон Бернулли получается из закона Чебышёва как частный случай. Достаточно ввести индикаторы $X_i = 1$, если событие в $i$-м испытании произошло, и $X_i = 0$ иначе. Тогда $X_i$ независимы, одинаково распределены (распределение Бернулли), $\mathbb{E}X_i = p$, $\mathbb{D}X_i = p(1-p)$. А среднее $\overline X_n$ — это в точности частота $W_n = m/n$. Осталось заметить универсальный факт: $p(1-p) \le 1/4$ при любом $p \in [0;1]$ (максимум достигается при $p=0{,}5$), значит дисперсия ограничена константой $C = 1/4$ для абсолютно любой вероятности $p$ — условие закона Чебышёва выполнено автоматически, для любого события на свете.
Теорема (закон больших чисел в форме Бернулли): Пусть проводится $n$ независимых испытаний, в каждом из которых событие $A$ наступает с одной и той же вероятностью $p$, и пусть $m$ — число испытаний, в которых $A$ произошло. Тогда частота события $W_n = m/n$ сходится по вероятности к $p$: для любого $\varepsilon > 0$
$$\lim_{n\to\infty} P(|W_n - p| < \varepsilon) = 1$$
Примеры с разбором
Пример 1 (простой): честная монета
Найди минимальный $n$, при котором Чебышёв гарантирует $P(|W_n - 0{,}5| \ge 0{,}05) \le 0{,}1$.
Решение. Здесь $p(1-p) = 0{,}25$ (симметричный, худший случай):
$$n \ge \frac{0{,}25}{0{,}0025 \cdot 0{,}1} = \frac{0{,}25}{0{,}00025} = 1000$$Ответ: нужна минимум тысяча бросков — довольно много для такой скромной точности $\pm 5$ п.п., что снова показывает, насколько консервативен именно инструмент Чебышёва (не сама теорема, а грубость данной оценки).
Пример 2 (средний): А/В-тест конверсии
Ты хочешь оценить долю пользователей, кликнувших на новую кнопку, с точностью $\pm 1$ п.п. и надёжностью 95% ($\alpha = 0{,}05$), не зная заранее истинную конверсию (то есть закладываясь на худший случай $p(1-p)=0{,}25$). Сколько пользователей нужно набрать в тест?
Решение.
$$n \ge \frac{0{,}25}{0{,}0001 \cdot 0{,}05} = \frac{0{,}25}{0{,}000005} = 50\,000$$Ответ: формально по Чебышёву нужно 50 000 пользователей. На практике аналитики почти всегда пользуются оценкой через ЦПТ (которая даст в те же ~5,2 раза меньше — около 9600), но важно понимать: Чебышёв даёт математически честную, безусловную гарантию, без всякого «при достаточно большом $n$» — она верна для любого $n$, а не только асимптотически.
Пример 3 (сложный): accuracy классификатора как частота Бернулли
Модель бинарной классификации заявляет accuracy $p = 0{,}95$. Ты проверяешь её на тесте из $n=400$ объектов. Найди чебышёвскую гарантию для $P(|\hat p - 0{,}95| \ge 0{,}02)$, используя настоящее (не худшее) значение $p(1-p)$. Затем найди, сколько объектов нужно, чтобы гарантия была не хуже $0{,}05$.
Решение. $p(1-p) = 0{,}95 \cdot 0{,}05 = 0{,}0475$.
При $n=400$: $\text{bound} = 0{,}0475/(400\cdot 0{,}0004) = 0{,}0475/0{,}16 \approx 0{,}297$.
Для гарантии $\le 0{,}05$: $n \ge 0{,}0475/(0{,}0004\cdot 0{,}05) = 0{,}0475/0{,}00002 = 2375$.
Ответ: на 400 объектах гарантия слабая (до 30%), нужно минимум 2375 объектов, чтобы Чебышёв уверенно обещал отклонение не больше $\pm2$ п.п. с вероятностью ошибки не выше 5%. Обрати внимание: accuracy — это в чистом виде частота события «модель угадала», а значит вся эта задача — прямое приложение закона Бернулли, просто переодетое в термины машинного обучения.
Почему это важно
Закон Бернулли — это теоретический фундамент под самым обыденным действием дата-сайентиста: измерить accuracy, precision, recall, конверсию, CTR — любую метрику-долю — на выборке и поверить получившемуся числу. Без этой теоремы нет никакой гарантии, что повторное измерение accuracy на другой случайной выборке того же размера даст похожий результат — возможно, частота вообще не стабилизируется никогда. Закон Бернулли доказывает: стабилизируется, и притом к конкретному, интерпретируемому числу — истинной вероятности успеха модели на генеральной совокупности данных. Это старейший результат теории вероятностей, и при этом самый часто используемый в прикладном ML факт, просто без вывески с именем.
Ошибка игрока: закон малых чисел
Интуиция
Вот куда обычно сворачивает неправильно понятая интуиция про ЗБЧ. Ты бросаешь честную монету, и пять раз подряд выпадает орёл. Кажется — раз в долгосрочной перспективе должно быть 50/50, то сейчас «вероятность» решки должна немного подрасти, чтобы всё «выровнялось». Это чувство настолько естественно, что у него есть отдельное название — ошибка игрока (gambler's fallacy), и оно систематически обыгрывает людей в казино, на бирже и в интерпретации A/B-тестов.
Ошибка ровно в том, что монета не помнит прошлое. Каждый бросок независим, и $P(\text{орёл}) = 0{,}5$ ровно так же после десяти орлов подряд, как и в самом первом броске. Закон больших чисел вообще ничего не говорит про «компенсацию» в короткой серии — он говорит только про предел при $n \to \infty$, причём именно про частоту (долю), а не про абсолютное число исходов. И здесь кроется тонкость, которую редко проговаривают вслух: абсолютная разность числа орлов и решек не сходится к нулю — она типично растёт по мере роста $n$, просто медленнее, чем растёт сам $n$, поэтому их отношение (частота) всё-таки стягивается к $1/2$. Психологи Амос Тверски и Даниэль Канеман в 1971 году описали зеркальную ошибку — веру, что даже небольшая выборка обязана статистически напоминать генеральную совокупность так же точно, как это гарантирует ЗБЧ лишь при $n \to \infty$, — и назвали её законом малых чисел: ложным ожиданием, что закон больших чисел начинает действовать уже на малых $n$.
Определение (ошибка игрока, закон малых чисел): Ошибка игрока — ошибочное убеждение, что после серии одинаковых исходов независимых испытаний вероятность противоположного исхода возрастает, чтобы «выровнять» статистику. Закон малых чисел — родственное когнитивное искажение, ошибочная вера в то, что даже небольшая выборка должна отражать истинные пропорции генеральной совокупности так же надёжно, как это гарантирует закон больших чисел лишь при достаточно большом $n$.
Примеры с разбором
Пример 1 (простой): пять орлов подряд
Честную монету бросили 5 раз, все пять раз выпал орёл. Какова вероятность, что шестой бросок тоже даст орла?
Решение. Броски независимы по условию честной монеты — прошлое никак не влияет на будущий бросок. $P(\text{орёл на 6-м броске}) = 0{,}5$, ровно как и в любом другом броске. Неправильное рассуждение «пять орлов подряд — уже редкость, дальше должна пойти решка для компенсации» игнорирует независимость: событие «пять орлов подряд, а потом решка» и событие «шесть орлов подряд» изначально были равновероятны ($0{,}5^6$ каждое), и ничего в уже случившемся не меняет условную вероятность следующего броска.
Ответ: $P = 0{,}5$, независимо от предыстории.
Пример 2 (средний): казино Монте-Карло, 18 августа 1913 года
Историческое событие: на колесе рулетки в казино Монте-Карло чёрное выпало подряд 26 раз. Игроки, уверенные, что «красное вот-вот обязано выпасть», ставили на красное всё большие суммы и потеряли миллионы франков. Оцени вероятность такой серии заранее (европейская рулетка, $p(\text{чёрное}) = 18/37 \approx 0{,}4865$, без учёта нуля) и вероятность того, что 27-й спин тоже будет чёрным, при условии, что уже случились 26 чёрных подряд.
Решение. Вероятность 26 чёрных подряд заранее: $(18/37)^{26} \approx e^{26 \ln(0{,}4865)} \approx e^{-18{,}73} \approx 7 \cdot 10^{-9}$ — примерно 1 шанс к 137 миллионам. Действительно исключительно редкое событие.
Но вероятность того, что 27-й спин тоже будет чёрным, при условии независимости спинов, не зависит от истории: $P(\text{чёрное}) = 18/37 \approx 0{,}4865$ — точно такая же, как и всегда.
Ответ: серия из 26 чёрных a priori невероятна (примерно $7\cdot10^{-9}$), но это не делает следующий спин ни капли более склонным к красному — независимые события не «должны» ничего компенсировать. Игроки, ставившие на красное с нарастающими суммами, теряли деньги именно потому, что путали редкость уже случившейся серии с предсказанием будущего.
Пример 3 (сложный): закон малых чисел в оценке модели
Дата-сайентист прогнал A/B-тест новой фичи рекомендаций всего на 40 пользователях в каждой группе: группа A (контроль) — конверсия 40%, группа B (новая фича) — конверсия 50%. Коллега торопится задеплоить: «разница в 10 п.п., закон больших чисел на нашей стороне». Оцени, насколько эта уверенность обоснована, посчитав чебышёвскую гарантию для отклонения при $n=40$ и $\varepsilon = 0{,}1$.
Решение. Худший случай $p(1-p) = 0{,}25$:
$$\text{bound} = \frac{0{,}25}{40 \cdot 0{,}01} = \frac{0{,}25}{0{,}4} = 0{,}625$$Ответ: гарантия Чебышёва здесь бесполезна — вероятность настолько большого случайного отклонения может достигать 62,5%. Коллега совершает ровно ошибку закона малых чисел: закон больших чисел действительно гарантирует сходимость частоты к истинной конверсии — но только при достаточно большом $n$, а на 40 наблюдениях эта гарантия ещё практически ничего не стоит. Разница в 10 п.п. на такой маленькой выборке с высокой вероятностью — просто шум.
Почему это важно
Ошибка игрока и закон малых чисел — не курьёз из учебника психологии, а систематическая причина дорогих решений: ставки, удваиваемые «потому что серия должна прерваться», ранняя остановка A/B-тестов на удачном (или неудачном) первом дне, выбор «лучшего» random seed по трём прогонам, интерпретация короткой просадки метрики модели в проде как катастрофы. Все эти сценарии объединяет одна и та же логическая ошибка: перенос гарантии, которая доказана только для предела при $n\to\infty$, на конкретное малое $n$, где эта гарантия ещё практически ничего не значит. Закон больших чисел учит доверять большим выборкам — но именно поэтому он же учит не доверять маленьким, и это вторая, куда менее очевидная сторона той же самой теоремы.
Практика: 30 заданий
Базовые (задания 1-10)
Задание 1: Случайная величина $X$ имеет $\mathbb{E}X = 50$, $\mathbb{D}X = 16$. Оцени по Чебышёву $P(|X-50| \ge 8)$.
Задание 2: $X$ имеет $\mu=0$, $\sigma=5$. Оцени $P(|X| \ge 15)$ через число сигм.
Задание 3: Известно $\sigma^2 = 9$. Найди минимальное $n$, при котором $\mathbb{D}\overline X_n \le 0{,}01$.
Задание 4: Кубик бросают $n=50$ раз, $\sigma^2 = 35/12$. Оцени по Чебышёву $P(|\overline X_{50} - 3{,}5| \ge 0{,}5)$.
Задание 5: Монету бросают $n=400$ раз. Оцени по Чебышёву $P(|W_{400} - 0{,}5| \ge 0{,}05)$.
Задание 6: Честная монета выпала орлом 10 раз подряд. Какова вероятность, что 11-й бросок тоже даст орла? Объясни, в чём ошибается человек, ожидающий решку.
Задание 7: Батч размера $B=200$, дисперсия вклада одного объекта в лосс $\sigma^2=1$. Оцени по Чебышёву $P(|\overline{\ell}_B - \mathbb{E}\ell| \ge 0{,}2)$.
Задание 8: Тест из $n=1000$ объектов, дисперсия индикатора ошибки в худшем случае $0{,}25$. Оцени $P(|\hat p - p| \ge 0{,}03)$.
Задание 9: Как изменится чебышёвская верхняя граница $P(|\overline X_n - \mu|\ge\varepsilon)$, если $n$ увеличить в 4 раза, а $\varepsilon$ и $\sigma^2$ оставить без изменений?
Задание 10: Верно ли утверждение: «закон больших чисел гарантирует, что абсолютная разность между числом орлов и числом решек в серии бросков монеты будет уменьшаться с ростом числа бросков»? Обоснуй.
Средние (задания 11-20)
Задание 11: Дано $\sigma^2=4$. Найди минимальное $n$, чтобы Чебышёв гарантировал $P(|\overline X_n - \mu| \ge 0{,}1) \le 0{,}02$.
Задание 12: А/В-тест конверсии, худшая дисперсия $0{,}25$. Найди минимальный $n$, чтобы Чебышёв гарантировал $P(|\hat p - p| \ge 0{,}02) \le 0{,}05$.
Задание 13: Дисперсия вклада одного объекта в градиент $\sigma^2=100$. Найди минимальный batch size $B$, чтобы Чебышёв гарантировал $P(|\hat g - g|\ge 2) \le 0{,}1$.
Задание 14: $\sigma^2=64$, $\varepsilon=1$. Сравни чебышёвскую границу для $B=32$ и $B=256$. Прокомментируй результат при $B=32$.
Задание 15: Кубик, $\sigma^2=35/12$. Найди минимальный $n$, чтобы Чебышёв гарантировал $P(|\overline X_n - 3{,}5| \ge 0{,}2) \le 0{,}1$.
Задание 16: Последовательность независимых величин имеет $\mathbb{D}X_i = i$ (дисперсия растёт линейно с номером). Применим ли закон больших чисел в форме Чебышёва? Проверь, стремится ли $\mathbb{D}\overline X_n$ к нулю.
Задание 17: На сервере фиксируется $n=10\,000$ запросов, истинная вероятность ошибки $p=0{,}001$. Оцени по Чебышёву (используя настоящее $p(1-p)$, а не худший случай) $P(|\hat p - 0{,}001| \ge 0{,}0005)$.
Задание 18: Нужна точность $\varepsilon=0{,}01$ с надёжностью 99% ($\alpha=0{,}01$), худший случай $\sigma^2=0{,}25$. Найди $n$ по Чебышёву и сравни с оценкой через ЦПТ ($z_{0{,}99}=2{,}576$).
Задание 19: На европейской рулетке ($p(\text{красное})=18/37$) после 15 красных подряд игрок ставит на чёрное, ожидая компенсации. Найди $P(\text{16-й спин красный})$ и вероятность априорной серии из 15 красных подряд.
Задание 20: Команда останавливает A/B-тест после $n=40$ пользователей в группе, увидев разницу конверсий в 10 п.п., и хочет катить фичу в прод, ссылаясь на закон больших чисел. Оцени чебышёвскую границу для $\varepsilon=0{,}1$ (худший случай) и оцени обоснованность решения.
Продвинутые (задания 21-30)
Задание 21: Выведи неравенство Чебышёва из неравенства Маркова для величины $X$ с $\mu=100$, $\sigma=15$, и проверь на числах $P(|X-100|\ge 30) \le \dots$
Задание 22: Последовательность величин имеет дисперсии, чередующиеся между 1 и 3 (то есть $\mathbb{D}X_i \in \{1,3\}$, значит $C=3$). Оцени по Чебышёву $P(|\overline X_{100} - \mu_{100}| \ge 0{,}1)$ и найди минимальный $n$ для границы $\le 0{,}05$.
Задание 23: Распределённое обучение: $B=64$ воркера, каждый выдаёт локальную оценку градиента с дисперсией $\sigma^2=8$. Найди дисперсию усреднённого по воркерам градиента и чебышёвскую границу для $\varepsilon=0{,}4$. Затем найди минимальное число воркеров для границы $\le 0{,}05$.
Задание 24: Тест собран из 3 неоднородных доменов: домен A ($n_A=300$, $\mathbb{D}\le 0{,}2$), домен B ($n_B=500$, $\mathbb{D}\le 0{,}3$), домен C ($n_C=200$, $\mathbb{D}\le 0{,}25$), всего $n=1000$. Оцени худшую чебышёвскую границу для $\varepsilon=0{,}02$.
Задание 25: При $n=100\,000$, $\varepsilon=0{,}01$, $\sigma=1$ сравни чебышёвскую границу с точным значением по ЦПТ ($z=\varepsilon\sqrt n/\sigma$).
Задание 26: Честная монета бросается до появления серии из 5 орлов подряд. Известна формула ожидаемого числа бросков до серии из $n$ орлов подряд: $\mathbb{E} = 2^{n+1}-2$. Найди ожидаемое число бросков для $n=5$ и прокомментируй с точки зрения ошибки игрока.
Задание 27: Фиксированный бюджет обучения — $N=100\,000$ обработанных примеров. Сравни batch size $B=100$ (1000 шагов) и $B=1000$ (100 шагов) по дисперсии оценки градиента на шаг, если $\sigma^2=50$ на один объект.
Задание 28: Построй пример трёх случайных величин, попарно независимых, но не независимых в совокупности, и проверь, что закон Чебышёва к ним всё равно применим. Возьми $X_1, X_2$ — независимые, каждая $\pm 1$ с вероятностью $1/2$, и $X_3 = X_1 X_2$.
Задание 29: Метод Монте-Карло для оценки $\pi$: $n=10\,000$ случайных точек в единичном квадрате, доля попавших в четверть круга радиуса 1 оценивает $p=\pi/4\approx 0{,}7854$. Оцени истинную (не худшую) дисперсию оценки $\hat\pi = 4m/n$ и чебышёвскую границу для $P(|\hat\pi - \pi| \ge 0{,}05)$.
Задание 30: Покажи математически, почему абсолютная разность $D_n$ числа орлов и числа решек в $n$ бросках честной монеты не сходится к нулю, а частота — сходится. Вычисли $\sigma(D_n)$ и типичную частотную ошибку при $n=10\,000$.
Частые ошибки
❌ Ошибка 1: ошибка игрока — «после серии одного исхода должен пойти другой»
Неправильно: «Монета 8 раз подряд выпала орлом, значит следующие несколько бросков дадут решку для компенсации».
Правильно: независимые испытания не имеют памяти. $P(\text{орёл на 9-м броске}) = 0{,}5$ независимо от истории — закон больших чисел говорит только про предел частоты при $n\to\infty$, и ничего не гарантирует про конкретное следующее испытание.
Почему важно: эта ошибка стоила состояний игрокам в казино Монте-Карло 1913 года и продолжает стоить денег каждому, кто удваивает ставку «потому что пора выиграть», — от рулетки до трейдинга.
❌ Ошибка 2: путать сходимость частоты со сходимостью абсолютного числа
Неправильно: «Если частота орлов сходится к 0,5, значит разница между количеством орлов и решек тоже стремится к нулю».
Правильно: сходится именно доля $m/n$, а абсолютная разность $D_n$ типично растёт по порядку $\sqrt n$ (см. задание 30). Закон больших чисел про относительные величины, а не про абсолютные счётчики.
Почему важно: без этого различия легко неправильно интерпретировать любой длинный лог событий — например, решить, что «модель за последние 10 000 запросов ошиблась на 40 раз больше, чем в среднем, значит она сломана», не заметив, что относительная частота ошибок при этом почти не изменилась.
❌ Ошибка 3: закон малых чисел — верить, что маленькой выборки уже достаточно
Неправильно: «У нас есть 30-40 наблюдений, закон больших чисел работает, можно доверять результату».
Правильно: ЗБЧ — асимптотическое утверждение о пределе при $n\to\infty$; при малых $n$ чебышёвская гарантия часто оказывается тривиальной (превышает 1) или практически бесполезной (см. задания 14, 20, 22). Прежде чем доверять среднему, надо явно посчитать, какую гарантию даёт конкретное $n$.
Почему важно: это самая частая методическая ошибка при досрочной остановке A/B-тестов и при выборе «лучшего» random seed по трём-пяти прогонам — оба случая интерпретируют шум как сигнал.
❌ Ошибка 4: требовать одинаковое распределение величин
Неправильно: «Для работы закона больших чисел все $X_i$ обязаны быть одинаково распределены».
Правильно: закон Чебышёва требует лишь ограниченной дисперсии ($\mathbb{D}X_i \le C$) и попарной независимости — величины могут иметь разные распределения и даже разные математические ожидания (тогда предел — среднее ожиданий, см. пример 3 раздела о законе Чебышёва).
Почему важно: реальные тестовые выборки почти никогда не бывают строго одинаково распределёнными (разные источники трафика, разные подгруппы пользователей) — и хорошо, что теорема этого и не требует.
❌ Ошибка 5: путать закон больших чисел с центральной предельной теоремой
Неправильно: «Закон больших чисел говорит, что среднее приблизительно нормально распределено вокруг $\mu$ с разбросом $\sigma/\sqrt n$».
Правильно: это утверждение ЦПТ (урок 241), а не ЗБЧ. Закон больших чисел лишь гарантирует, что среднее сходится к $\mu$ — без единого слова про форму распределения и скорость сходимости.
Почему важно: ЗБЧ даёт факт существования предела, ЦПТ даёт практический инструмент для расчёта доверительных интервалов; путаница между ними приводит к неправильному выбору формулы при расчёте нужного размера выборки.
❌ Ошибка 6: применять предел закона больших чисел к одному конкретному будущему испытанию
Неправильно: «Раз в среднем модель угадывает 90% объектов, то вот этот конкретный объект она угадает с вероятностью 90%».
Правильно: закон больших чисел — утверждение про среднее по множеству испытаний, а не про отдельно взятый объект. Вероятность правильного ответа на конкретном объекте зависит от его собственных признаков и может очень сильно отличаться от общей accuracy.
Почему важно: это смешивает two совершенно разных вопроса — «какова средняя точность модели» и «насколько я уверен в ответе именно на этом объекте» (второе — предмет калибровки вероятностей, отдельная и не менее важная тема).
Главное запомнить
-
Закон больших чисел (ЗБЧ) утверждает, что среднее по большому числу независимых испытаний сходится по вероятности к своему математическому ожиданию — это утверждение о пределе при $n\to\infty$, а не про поведение при конкретном малом $n$.
-
Неравенство Чебышёва $P(|X-\mu|\ge\varepsilon) \le \sigma^2/\varepsilon^2$ — техническая основа доказательства; работает для абсолютно любого распределения с конечной дисперсией, но даёт грубую (worst-case) оценку.
-
Закон Чебышёва (общая форма): для попарно независимых величин с равномерно ограниченной дисперсией ($\mathbb{D}X_i \le C$) среднее сходится по вероятности к среднему математических ожиданий. Одинаковое распределение не требуется.
-
Закон Бернулли (частный случай): частота события $W_n=m/n$ в $n$ независимых испытаниях сходится по вероятности к вероятности события $p$ — старейшая и самая узнаваемая форма ЗБЧ, прямое обоснование того, почему измеренная accuracy стремится к истинному качеству модели.
-
ЗБЧ vs ЦПТ: закон больших чисел отвечает на вопрос «куда сходится среднее», центральная предельная теорема (урок 241) — «с какой скоростью и какой формы» облако вокруг предела. Это две разные, дополняющие друг друга теоремы, а не синонимы.
-
Ошибка игрока — ложное убеждение, что случайность обязана «выравниваться» в короткой серии независимых испытаний; независимые события не имеют памяти о прошлом.
-
Закон малых чисел — родственная ошибка: перенос гарантии закона больших чисел (доказанной для предела) на конкретное малое $n$, где она ещё практически ничего не значит.
-
Абсолютная разность vs частота: число орлов минус число решек обычно растёт по порядку $\sqrt n$, тогда как их отношение (частота) стремится к $1/2$ — сходится именно доля, а не абсолютный счётчик.
-
В ML — тестовая выборка: оценка ошибки модели на тесте — это среднее по $n$ независимым слагаемым, и её сходимость к истинному риску на генеральной совокупности данных гарантирована законом больших чисел (в форме Чебышёва или Бернулли, в зависимости от метрики).
-
В ML — размер батча: дисперсия оценки градиента по батчу убывает как $C/B$, и по ЗБЧ эта оценка сходится к истинному градиенту по всему датасету при $B\to\infty$ — теоретическая основа наблюдения «большие батчи дают более гладкое обучение».
Связь с другими темами курса
Что было до этого урока. Весь фундамент взят из уроков 237-241. Из урока 237 — математическое ожидание и его линейность. Из урока 238 — дисперсия и, что важнее всего, само неравенство Чебышёва, которое здесь стало главным рабочим инструментом доказательства. Из урока 240 — распределение Бернулли, чья дисперсия $p(1-p)\le 1/4$ оказалась ключевым фактом для закона Бернулли. Из урока 241 — центральная предельная теорема, с которой мы постоянно сравнивали закон больших чисел, чтобы провести чёткую границу между «куда» и «как быстро».
Что дальше. Урок 243 переходит к многомерным случайным величинам — совместным распределениям пары или большего числа величин; там же появится ковариация, которая в уроке 244 станет отдельной темой. Закон больших чисел там тоже будет неявно присутствовать: любая совместная оценка (выборочная ковариация, выборочная корреляция) — это тоже среднее по объектам выборки, и её сходимость к истинному значению — снова следствие сегодняшней теоремы, просто применённой к произведению отклонений вместо самих величин. Дальше по курсу, в блоке про выборку и оценку параметров (уроки 245-246), закон больших чисел станет фундаментом понятия состоятельности оценки — свойства, которое ты будешь проверять для каждого статистического метода.
Где это применяется в жизни и в ML/данных:
💰 Страхование и азартные игры: актуарные тарифы строятся на том, что средний убыток по большому портфелю полисов сходится к ожидаемому — это буквально применение закона Бернулли, известное задолго до формального доказательства (таблицы смертности Эдмунда Галлея, 1693 год).
🧪 Тестирование моделей и A/B-эксперименты: размер тестовой выборки или экспериментальной группы напрямую определяет, насколько измеренная метрика близка к истинной — закон больших чисел объясняет, почему нельзя доверять результату на 40 наблюдениях так же, как результату на 40 000.
🔧 Обучение нейросетей: размер батча в SGD управляет дисперсией оценки градиента через тот же механизм $C/B$; кросс-валидация усредняет оценки качества по фолдам, полагаясь на ту же сходимость.
📊 Метод Монте-Карло: оценка интегралов, вероятностей редких событий, площадей и объёмов случайным сэмплированием — весь метод стоит на законе больших чисел, ничего больше.
🎰 Азартные игры и казино: казино зарабатывает не потому, что выигрывает каждую отдельную партию, а потому что при огромном числе партий средний результат сходится к математическому ожиданию в пользу заведения — и именно поэтому ошибка игрока систематически обыгрывает клиентов.
Интересные факты
💡 Якоб Бернулли работал над доказательством около 20 лет и называл результат «theorema aureum» — золотой теоремой, — понимая её значение задолго до завершения. Он умер в 1705 году, так и не опубликовав работу; «Ars Conjectandi» вышла лишь в 1713-м стараниями его племянника Николая Бернулли.
💡 Термин «закон больших чисел» придумал не Бернулли, а Симеон Дени Пуассон — только в 1835 году, спустя более ста лет после первой теоремы. Пуассон же обобщил результат на случай, когда вероятность успеха может немного меняться от испытания к испытанию.
💡 Неравенство Чебышёва работает даже для распределений, у которых нет названия. Единственное требование — конечная дисперсия. Это делает его одним из немногих по-настоящему универсальных инструментов теории вероятностей: он одинаково честно работает и для нормального распределения, и для экзотической смеси, придуманной вчера вечером для конкретной задачи.
💡 Джон Керрич бросил монету 10 000 раз в лагере для интернированных во время Второй мировой войны (эта история уже упоминалась в уроке 226) и получил 5067 орлов — частоту 0,5067. Его записи промежуточных частот наглядно показывают закон больших чисел в действии: коридор колебаний частоты вокруг 0,5 неуклонно сужается по мере роста числа бросков, в точности как предсказывает теорема.
💡 Первые актуарные таблицы появились раньше формального доказательства ЗБЧ. Эдмунд Галлей построил таблицу смертности для города Бреслау в 1693 году, за двадцать лет до публикации Бернулли, — страховое дело интуитивно опиралось на статистическую устойчивость средних задолго до того, как эта устойчивость получила строгое математическое обоснование.
Лайфхаки и полезные трюки
1. Перед тем как доверять метрике, спроси: «по скольким независимым наблюдениям она посчитана?»
Число $n$ определяет всё. Accuracy 95% на 20 объектах и accuracy 95% на 20 000 объектов — это два совершенно разных по надёжности утверждения, хотя число одно и то же.
2. Используй worst-case дисперсию $0{,}25$ как быструю прикидку для любой доли
Для accuracy, конверсии, CTR и любой другой метрики-доли максимум $p(1-p)$ достигается при $p=0{,}5$ и равен $0{,}25$ — это позволяет посчитать консервативную границу Чебышёва (или ЦПТ) за десять секунд в уме, не зная точного $p$ заранее.
3. Не путай «теорема верна» с «гарантия уже сработала на моём $n$»
Прежде чем принимать решение по маленькой выборке, явно посчитай чебышёвскую (или, лучше, основанную на ЦПТ) границу для своего конкретного $n$ — если она получается больше 0,5 или даже больше 1, никакой практической гарантии у тебя нет, вне зависимости от того, что теорема в принципе верна.
4. Если обучение «трясёт» — увеличь batch size, а не снижай learning rate вслепую
Шум оценки градиента убывает как $C/B$ — прямое следствие закона больших чисел. Если дёргающийся лосс мешает сходимости, часто эффективнее увеличить батч (или использовать gradient accumulation), чем просто уменьшить шаг обучения, который лечит симптом, но не причину шума.
5. Зафиксируй размер выборки для A/B-теста заранее и не поддавайся соблазну остановиться раньше
Досрочная остановка теста на «удачном» промежуточном результате — прямое проявление закона малых чисел: маленькая промежуточная выборка ещё не даёт содержательной гарантии, даже если разница выглядит впечатляюще.
6. Прежде чем считать серию «аномалией», прикинь, насколько она на самом деле обычна
Формула ожидаемой длины ожидания серии ($2^{n+1}-2$ для $n$ одинаковых исходов подряд у честной монеты, задание 26) часто показывает, что «подозрительная» серия — совершенно рутинное явление в достаточно длинной случайной последовательности, а не сигнал о поломке или мошенничестве.
Закон больших чисел — редкий случай теоремы, интуитивно понятной ещё до всякой математики и при этом требующей по-настоящему аккуратного доказательства, чтобы не превратиться в житейское заблуждение. Разница между «я чувствую, что среднее должно стабилизироваться» и «я знаю точное неравенство, гарантирующее это стабилизирование при заданном $n$» — это ровно разница между интуицией и инженерией. Именно на этой теореме держится обоснованность самого понятия «оценить точность модели на тесте» и самого понятия «уменьшить шум градиента увеличением батча» — не как эмпирических трюков, а как строго доказанных следствий одной и той же идеи, впервые сформулированной Якобом Бернулли три века назад.
В следующем уроке (243) мы сделаем шаг в сторону — от одной случайной величины к паре и более: многомерные случайные величины, совместные распределения и то, как величины связаны друг с другом. Это откроет дорогу к ковариации, корреляции и, в конце концов, к пониманию того, почему линейная регрессия и метод главных компонент вообще работают. Увидимся в уроке 243 🚀
Понял тему? Закрепи в боте! 🚀
Попрактикуйся на задачах и получи персональные рекомендации от AI
💪 Начать тренировку