🔴 Сложный ⏱️ 45 минут

Выборка и генеральная совокупность

📋 Содержание урока

Выборка и генеральная совокупность 🎯

Когда ты обучаешь модель, ты скармливаешь ей тренировочный датасет — конечный набор строк, которые кто-то когда-то собрал. Но работать модель будет не на этих строках. Она будет работать на новых пользователях, которые зарегистрируются через полгода, на новых фотографиях, снятых на новый телефон, на транзакциях, которые ещё не произошли. Тренировочный датасет — это лишь маленький, доступный тебе кусок того огромного, часто бесконечного и никогда не наблюдаемого целиком множества данных, на которых модели предстоит работать в реальности. Первое множество в статистике называется выборкой, второе — генеральной совокупностью. Вся теория обобщающей способности моделей, весь разговор о переобучении и недообучении, вся тревога дата-сайентиста по поводу того, «а не подглядела ли модель что-то лишнее» — всё это в конечном счёте разговор об одном и том же вопросе: насколько хорошо выборка, на которой ты обучаешь и проверяешь модель, представляет генеральную совокупность, на которой модель будет реально работать.

Разница между выборкой и генеральной совокупностью — не абстрактная философская тонкость, а источник вполне конкретных катастроф. Модель кредитного скоринга, обученная только на клиентах, которым банк уже одобрил кредит, никогда не видела клиентов, которым отказали, — и её представление о том, кто «хороший» заёмщик, будет искажено. Модель компьютерного зрения, обученная на фотографиях, снятых при дневном свете в помещении с хорошим освещением, откажет ночью на улице. Модель, предсказывающая отток клиентов и обученная только на тех, кто сам заполнил анкету обратной связи, скорее всего, обучилась предсказывать поведение вовлечённых, лояльных пользователей — а не всей клиентской базы. В каждом из этих случаев данные, на которых обучалась модель, — это не случайный срез генеральной совокупности, а смещённая выборка: подмножество, которое систематически, не по случайности, отличается от целого.

Прежде чем говорить об оценке параметров, о доверительных интервалах и проверке гипотез — а весь следующий блок курса посвящён именно этому, — нужно договориться о языке. Что именно мы оцениваем, когда считаем среднее по датасету? Какое множество объектов стоит за словом «мы хотим узнать»? И главное — при каких условиях кусок данных, который у тебя есть, вообще имеет право что-то говорить о целом, которого у тебя нет и никогда не будет? Этот урок — фундамент статистического вывода: раздела статистики, который занимается именно этим переходом от частного к общему.

🎯 Ты узнаешь:

  • Чем генеральная совокупность отличается от выборки и почему это разделение — не формальность, а сердце статистического мышления
  • Что такое репрезентативность выборки и почему случайная выборка — это способ её обеспечить, а не гарантия сама по себе
  • Что такое смещённая выборка (систематическая ошибка отбора), на классическом историческом примере и на примерах из машинного обучения
  • Что такое выборочные статистики — выборочное среднее и выборочная дисперсия — и почему они лишь оценки, а не точные значения параметров генеральной совокупности
  • Почему в формуле выборочной дисперсии в знаменателе стоит $n-1$, а не $n$ — и откуда взялась эта поправка Бесселя

История: откуда это взялось?

Вечером 2 ноября 1936 года читатели американского журнала Literary Digest были уверены в исходе президентских выборов: республиканец Альф Лэндон победит действующего президента Франклина Рузвельта с разгромным счётом — 57% против 43%. Журнал опирался не на догадки, а на данные: он разослал почти 10 миллионов открыток избирателям по всей стране и получил обратно свыше 2,4 миллиона заполненных ответов — по тем временам колоссальная для социологии выборка, которой позавидовал бы любой современный опрос. Четыре предыдущих выборки подряд Literary Digest угадывал победителя, и редакция не сомневалась в методе.

На следующий день после выборов выяснилось: Рузвельт выиграл в 46 из 48 штатов, набрав около 61% голосов — один из самых разгромных результатов в истории американских выборов, причём в направлении, ровно противоположном прогнозу. Причина провала оказалась не в размере выборки — 2,4 миллиона ответов и сегодня выглядели бы гигантским числом, — а в том, откуда эта выборка была набрана. Адреса для рассылки журнал брал из телефонных справочников, списков владельцев автомобилей и собственной базы подписчиков. В разгар Великой депрессии телефон и автомобиль были роскошью, доступной преимущественно состоятельным американцам, — а среди них республиканские взгляды были распространены заметно шире, чем в среднем по стране. Сверху на это наложился второй эффект: ответить на открытку и отправить её обратно почтой — усилие, на которое чаще соглашались люди, недовольные действующей властью и мотивированные высказаться. Оба искажения тянули в одну сторону, и никакой размер выборки не мог это компенсировать.

Тем временем молодой статистик Джордж Гэллап поступил иначе: вместо того чтобы разослать миллионы открыток случайным способом сбора, он построил выборку всего из около 50 000 человек, подобранную так, чтобы её состав по доходу, полу, возрасту и месту жительства соответствовал известной структуре населения страны — метод, который позже разовьётся в современную технику квотной и стратифицированной выборки. Гэллап не просто предсказал победу Рузвельта — он ещё и заранее, до самих выборов, публично предсказал, что именно Literary Digest ошибётся, и назвал причину. Журнал закрылся спустя полтора года — его репутация не пережила этого провала, а история вошла в учебники статистики как хрестоматийный пример того, что размер выборки и её репрезентативность — совершенно разные вещи, и большая нерепрезентативная выборка может быть куда опаснее маленькой случайной, потому что она внушает ложную уверенность. Всего двумя годами ранее, в 1934 году, польский статистик Ежи Нейман опубликовал работу, заложившую строгую математическую теорию репрезентативной выборки и случайного отбора, — та же самая теория, которая задним числом объяснила, что именно пошло не так у Literary Digest, и которая лежит в основе того, как сегодня разбивают датасет на обучающую и тестовую части.


Генеральная совокупность и выборка

Интуиция: океан и черпак воды

Представь океанолога, которому нужно узнать среднюю солёность воды в океане. Измерить солёность в каждой точке океана физически невозможно — он бесконечно велик по сравнению с любым прибором. Поэтому учёный набирает черпаком несколько сотен проб воды в разных местах и по ним судит обо всём океане. Океан целиком — это генеральная совокупность: множество объектов (здесь — буквально каждая молекула воды или каждая точка пространства), которое реально интересует исследователя. Набор проб — это выборка: доступное, конечное, физически измеримое подмножество, на котором и проводятся все реальные измерения.

В машинном обучении роль океана играет не что-то экзотическое, а самое обычное «всё, с чем модель когда-либо столкнётся в проде»: все пользователи сервиса, включая тех, кто ещё не зарегистрировался; все фотографии, которые когда-либо будут загружены; все транзакции, которые ещё произойдут. Это множество часто не просто велико — оно не существует целиком в момент обучения модели, потому что часть его лежит в будущем. Тренировочный и тестовый датасеты — это черпак, которым дата-сайентист зачерпнул из этого бесконечного, постоянно растущего океана данных небольшую, доступную ему порцию.

Определение: Генеральная совокупность — это всё множество объектов (людей, измерений, событий), которое интересует исследователя и о котором он хочет сделать вывод. Выборка — это подмножество генеральной совокупности, реально доступное для наблюдения и измерения. Число объектов в генеральной совокупности принято обозначать $N$ (часто $N \to \infty$ или $N$ неизвестно), число объектов в выборке — $n$, где почти всегда $n \ll N$.

Важная тонкость: генеральная совокупность не обязана быть физически существующим набором предметов. Иногда это концептуальное множество — например, «все возможные исходы эксперимента, который в принципе можно повторять бесконечно». Именно так стоит понимать генеральную совокупность в машинном обучении: это не список конкретных десяти тысяч пользователей, а абстрактное, теоретическое распределение $p(\mathbf{x}, y)$, из которого, как предполагается, независимо друг от друга «выбираются» и обучающие, и будущие, ещё не увиденные объекты.

Примеры с разбором

Пример 1 (лёгкий). В школе учится $1200$ учеников. Администрация хочет узнать, довольны ли ученики новым расписанием, и раздаёт анкету случайно выбранным $50$ ученикам. Определи генеральную совокупность и выборку, укажи $N$ и $n$.

Генеральная совокупность — все ученики школы, чьё мнение хочет узнать администрация: $N=1200$. Выборка — те $50$ учеников, которым реально раздали анкету и от которых получили ответ: $n=50$. Обрати внимание: генеральная совокупность здесь конечна и точно известна — это не абстракция, а список из $1200$ реальных фамилий, доступных администрации школы при желании опросить каждого. Это самый простой случай, но уже здесь возникает вопрос, к которому мы вернёмся ниже: как именно выбраны эти $50$ учеников — этот вопрос решает, можно ли доверять результату опроса.

Пример 2 (средний). Компания хочет построить модель, предсказывающую отток (уход) клиентов — причём не только нынешних, но и всех будущих клиентов, которые придут в компанию в последующие годы. Для обучения модели дата-сайентист использует исторические записи о $10\,000$ клиентов за последние три года. Опиши, что здесь является генеральной совокупностью, и почему её невозможно наблюдать целиком.

Генеральная совокупность здесь — это все клиенты компании: и прошлые, и нынешние, и будущие, то есть множество принципиально незамкнутое, растущее во времени. Формально её удобнее описывать не как список конкретных людей, а как распределение $p(\mathbf{x}, y)$ — вероятностный закон, по которому «рождаются» характеристики клиента $\mathbf{x}$ (возраст, тариф, активность) и метка оттока $y$. Выборка — это $10\,000$ исторических записей, доступных дата-сайентисту сегодня. Ключевая трудность в том, что генеральную совокупность здесь нельзя наблюдать целиком даже в принципе: часть её (будущие клиенты) физически ещё не существует в момент, когда модель обучают. Вся ставка модели строится на неявном предположении, что клиенты из выборки и клиенты из будущего — это независимые, одинаково распределённые реализации одной и той же генеральной совокупности. Если это предположение нарушается — например, компания резко меняет рынок или ценовую политику, — модель, обученная на старых данных, начинает ошибаться, потому что генеральная совокупность буквально «уехала» из-под выборки, на которой её обучали.

Пример 3 (сложный). Завод производит партию лампочек. Чтобы оценить среднее время жизни лампочки, инженер берёт случайные $40$ штук из партии и тестирует их до полного перегорания. Почему в этом случае нельзя протестировать всю генеральную совокупность, даже если бы захотели, — и как это меняет саму постановку задачи?

Здесь генеральная совокупность — это все лампочки, выпущенные (и, в более широком смысле, которые в принципе может выпустить) этой производственной линией: величина либо конечная, но огромная, либо концептуально бесконечная, если считать линию непрерывным процессом. Но дело не только в размере: тест на срок службы — разрушающий. Протестировать лампочку до перегорания означает уничтожить её как товар. Если протестировать все лампочки партии, продавать будет нечего — сама генеральная совокупность исчезнет в процессе измерения. Поэтому выборка размером $n=40$ — это не просто вопрос удобства или экономии времени (как в примере с опросом школьников), а физическая необходимость: измерение генеральной совокупности целиком противоречило бы самой цели существования этой совокупности. Это крайний, но крайне поучительный случай: он показывает, что выборка бывает не «уменьшенной копией» генеральной совокупности ради удобства, а единственно возможным способом узнать о ней хоть что-то в принципе. Ровно та же логика работает в краш-тестах автомобилей, в A/B-тестировании нового дизайна сайта (нельзя показать новый дизайн вообще всем и сразу без риска) и в клинических испытаниях лекарств.

Почему это важно. Путаница между выборкой и генеральной совокупностью — источник, наверное, самой распространённой методологической ошибки в анализе данных: подмены вопроса «что я вижу в своих данных» вопросом «что верно вообще». Метрика качества модели, посчитанная на тестовой выборке, — это оценка того, как модель поведёт себя на генеральной совокупности, а не точное значение этого поведения. Как только ты перестаёшь различать эти два уровня, ты рискуешь либо слепо доверять числу с тестовой выборки как абсолютной истине, либо, наоборот, не понимать, зачем вообще нужна статистика, если «у меня и так есть все данные» — а данные, которые у тебя есть, почти никогда не являются полной генеральной совокупностью, даже когда кажутся исчерпывающими.


Репрезентативность и случайная выборка

Интуиция: хорошо перемешанный суп

Представь, что ты варишь большую кастрюлю супа и хочешь на вкус проверить, достаточно ли соли. Если суп хорошо перемешан, одной ложки, зачерпнутой в любом месте кастрюли, достаточно, чтобы судить о вкусе всего супа. Если же соль осела на дне, а сверху плавает жир, одна ложка с поверхности даст совершенно неверное представление о вкусе целого. Разница между этими двумя ситуациями — это ровно разница между репрезентативной и нерепрезентативной выборкой: вопрос не в том, сколько ложек ты попробовал, а в том, отражает ли содержимое ложки состав всей кастрюли.

Репрезентативность — это свойство выборки в целом (соответствует ли распределение признаков в выборке распределению признаков в генеральной совокупности), а не свойство отдельного объекта в ней. Одна ложка супа не обязана содержать частицу каждого ингредиента — она должна лишь сохранять те же пропорции, что и весь суп. Так же и выборка из $50$ клиентов не обязана включать представителя каждого возможного сочетания признаков — она должна лишь не искажать систематически общую картину: если в генеральной совокупности $30\%$ клиентов — новые, значит и в хорошей выборке должно быть примерно $30\%$ новых, а не $5\%$ и не $80\%$.

Самый надёжный (хотя и не единственный) способ добиться репрезентативности — это случайная выборка: отбор объектов, при котором каждый объект генеральной совокупности имеет одинаковую, заранее известную вероятность попасть в выборку, и отбор одного объекта никак не влияет на вероятность отбора другого. Случайность здесь — не синоним «произвольности» или «как попало»: наоборот, это строгая процедура, которая математически гарантирует отсутствие систематического перекоса в сторону какой-либо группы, хотя и не исключает случайных колебаний состава конкретной выборки.

Определение: Выборка называется репрезентативной, если распределение интересующих исследователя характеристик в выборке достаточно точно соответствует их распределению в генеральной совокупности. Простой случайной выборкой называется способ отбора, при котором каждое подмножество генеральной совокупности заданного размера $n$ имеет одинаковую вероятность быть выбранным; в частности, каждый отдельный объект генеральной совокупности попадает в выборку с одной и той же вероятностью $\dfrac{n}{N}$.

Случайная выборка не гарантирует стопроцентной репрезентативности каждой конкретной реализации — по чистой случайности могла набраться выборка, где, скажем, женщин заметно больше, чем в генеральной совокупности. Но она гарантирует, что в среднем, по всем возможным выборкам, которые могли бы получиться, никакого систематического перекоса нет: выборочное среднее любого признака, посчитанное по случайной выборке, является несмещённой оценкой среднего этого признака в генеральной совокупности (к этому мы вернёмся в разделе про выборочные статистики). Это принципиально отличает случайную выборку от смещённой, где перекос систематический и не исчезает даже при увеличении размера выборки — именно об этом следующий раздел.

Примеры с разбором

Пример 1 (лёгкий). В мешке лежат $100$ шаров: $60$ красных и $40$ синих. Из мешка вслепую, случайно вынимают $10$ шаров (без возвращения). Какова вероятность того, что конкретный красный шар, лежащий в мешке, окажется в выборке?

По определению простой случайной выборки каждый из $100$ шаров имеет равную вероятность попасть в выборку размера $n=10$ из генеральной совокупности размера $N=100$:

$$P(\text{конкретный шар в выборке}) = \frac{n}{N} = \frac{10}{100} = 0{,}1.$$

Эта вероятность одинакова для любого шара — красного или синего, лежащего сверху или снизу мешка. Именно это равенство вероятностей для всех объектов и есть математическое ядро понятия «случайная выборка»: она не гарантирует, что ровно $6$ из $10$ вынутых шаров окажутся красными (в конкретной выборке может выйти и $5$, и $8$), но гарантирует отсутствие каких-либо систематических причин, по которым красные шары попадали бы в выборку чаще или реже синих.

Пример 2 (средний). В компании работает $1000$ сотрудников: $300$ руководителей и $700$ рядовых специалистов. Отдел кадров хочет опросить $100$ сотрудников об удовлетворённости работой, используя стратифицированную выборку — то есть предварительно разбив генеральную совокупность на группы (страты) по должности и отобрав из каждой группы долю, пропорциональную её размеру в генеральной совокупности. Сколько руководителей и сколько рядовых специалистов должно попасть в такую выборку?

Доля руководителей в генеральной совокупности: $\dfrac{300}{1000} = 0{,}30$, доля рядовых специалистов: $\dfrac{700}{1000} = 0{,}70$. Стратифицированная выборка сохраняет эти пропорции внутри выборки размера $n=100$:

$$n_{\text{руководители}} = 0{,}30 \cdot 100 = 30, \qquad n_{\text{специалисты}} = 0{,}70 \cdot 100 = 70.$$

Стратифицированная выборка — это усиленная версия идеи случайной выборки: внутри каждой страты отбор всё равно случайный, но само разбиение на страты гарантированно устраняет один конкретный источник перекоса — случайное недо- или перепредставление конкретной группы, которое иначе могло бы получиться просто по воле случая при обычной простой случайной выборке из всех $1000$ сотрудников сразу.

Пример 3 (сложный). Дата-сайентист строит модель обнаружения мошеннических транзакций. Всего в датасете $10\,000$ транзакций, из них $200$ мошеннических (доля $2\%$). Для проверки качества модели он откладывает тестовую выборку размером $100$ транзакций ($1\%$ от датасета), отбирая её простой случайной выборкой без учёта класса. Найди ожидаемое число мошеннических транзакций в тестовой выборке и оцени (приближённо, через биномиальное распределение) вероятность того, что среди отложенных $100$ транзакций не окажется ни одной мошеннической.

Ожидаемое число мошеннических транзакций в тестовой выборке при доле мошенничества $2\%$:

$$\mathbb{E}[\text{мошеннических в тесте}] = 100 \cdot 0{,}02 = 2.$$

Число два — уже само по себе очень маленькое: результат теста будет сильно зависеть от того, попали ли конкретные две-три мошеннические транзакции в выборку. Оценим вероятность того, что ни одной не попадёт, приближая отбор без возвращения независимыми испытаниями (это допустимо, поскольку $100 \ll 10\,000$):

$$P(\text{ноль мошеннических}) \approx (1-0{,}02)^{100} = 0{,}98^{100}.$$

Прологарифмируем: $\ln(0{,}98) \approx -0{,}020203$, тогда $100 \cdot (-0{,}020203) = -2{,}0203$, и $e^{-2{,}0203} \approx 0{,}1326$. Значит, вероятность того, что случайно отобранная тестовая выборка вообще не содержит ни одного примера мошенничества, составляет примерно $13\%$ — вовсе не пренебрежимо малая величина! Если так случится, метрика полноты модели на этой тестовой выборке будет попросту не определена или введёт в заблуждение. Именно поэтому на практике для сильно несбалансированных классов простую случайную выборку заменяют на стратифицированное разбиение (в scikit-learn — параметр stratify в train_test_split), которое принудительно сохраняет долю редкого класса и в обучающей, и в тестовой выборке, устраняя именно этот риск.

Почему это важно. Репрезентативность — это не абстрактное требование учебника статистики, а прямое условие того, что метрики, посчитанные на тестовой выборке модели, вообще что-то значат. Если тестовая выборка нерепрезентативна — например, случайно содержит слишком мало примеров редкого, но важного класса, — метрика качества модели будет вводящей в заблуждение оценкой её реального поведения на генеральной совокупности. Случайная (и, для несбалансированных данных, стратифицированная) выборка — это не формальность из методички, а конкретный технический приём, без которого числа на выходе модели нельзя интерпретировать всерьёз.


Смещённая выборка: когда «больше данных» не помогает

Интуиция: кого ты вообще спрашиваешь

Вернись к истории про журнал Literary Digest из начала урока: почти $2{,}4$ миллиона ответов — и катастрофически неверный прогноз. Проблема была не в размере выборки, а в механизме отбора: список адресов набирался из источников (телефонные справочники, списки владельцев автомобилей), систематически смещённых в сторону более состоятельных людей. Это классический пример смещённой выборки, или систематической ошибки отбора: ситуации, когда способ, которым объекты попадают в выборку, сам по себе связан с изучаемым признаком. В таком случае увеличение размера выборки не решает проблему — оно лишь делает неверный ответ более «уверенным», потому что случайный разброс уменьшается, а систематический сдвиг остаётся на месте.

Важно отличать два источника смещения, которые часто действуют вместе. Первый — смещение рамки выборки: сам список, из которого производится отбор, уже не совпадает с генеральной совокупностью, которую хотят изучить (телефонные справочники 1936 года — это не «все избиратели», а «состоятельные избиратели»). Второй — смещение самоотбора: даже если рамка выборки идеальна, люди, которые сами решают откликнуться (заполнить анкету, оставить отзыв, ответить на звонок), систематически отличаются от тех, кто промолчал. Оба механизма объединяет одно: выборка перестаёт быть случайной по отношению к признаку, который на самом деле нас интересует.

Определение: Смещённая выборка (систематическая ошибка отбора) — это выборка, полученная таким способом, при котором вероятность попадания объекта в выборку связана с интересующим исследователя признаком. В отличие от случайной ошибки выборки (разброса результата от выборки к выборке из-за конечности $n$), систематическая ошибка отбора не уменьшается с ростом размера выборки $n$ и не исчезает даже при $n \to N$ в пределах смещённой рамки — устранить её может только изменение самого способа отбора данных.

Примеры с разбором

Пример 1 (лёгкий). Разработчики нового фитнес-приложения хотят узнать, насколько людям в целом нравится их продукт. Они проводят опрос среди пользователей, которые уже установили и активно используют другие похожие приложения. Почему такая выборка смещена и в какую сторону?

Генеральная совокупность, которую хочет изучить компания, — это «люди вообще», потенциальная аудитория продукта, включая тех, кто никогда не пользовался фитнес-приложениями. Выборка же набрана исключительно среди людей, которые уже заведомо заинтересованы в теме фитнеса и приложений такого рода, — эта группа систематически более расположена к позитивной оценке любого продукта в этой категории, чем случайный человек с улицы. Оценка удовлетворённости, полученная на такой выборке, будет смещена вверх: она переоценивает реальный интерес и удовлетворённость широкой аудитории, потому что сама процедура отбора («кто уже пользуется похожими приложениями») коррелирует с изучаемым признаком («понравится ли фитнес-продукт»).

Пример 2 (средний). Исследователь хочет узнать средний доход жителей города. Истинная структура населения такова: $70\%$ горожан работают, их средний доход — $60\,000$ рублей в месяц; оставшиеся $30\%$ — неработающие (пенсионеры, студенты, домохозяйки), их средний доход — $20\,000$ рублей. Истинный средний доход по генеральной совокупности:

$$\mu_{\text{истинное}} = 0{,}70 \cdot 60\,000 + 0{,}30 \cdot 20\,000 = 42\,000 + 6\,000 = 48\,000 \text{ рублей}.$$

Исследователь, однако, проводит опрос в торговом центре в будний день в первой половине дня — время, когда работающие люди находятся на работе, а среди посетителей торгового центра преобладают неработающие. Пусть среди опрошенных в такой момент реальная структура окажется обратной интуиции: только $25\%$ работающих и $75\%$ неработающих. Оценённый по этой смещённой выборке средний доход:

$$\bar{x}_{\text{смещённая выборка}} = 0{,}25 \cdot 60\,000 + 0{,}75 \cdot 20\,000 = 15\,000 + 15\,000 = 30\,000 \text{ рублей}.$$

Разница между истинным значением $48\,000$ и оценкой $30\,000$ составляет $18\,000$ рублей — то есть смещённая выборка занижает реальный средний доход почти на $37{,}5\%$. Никакое увеличение числа опрошенных в том же торговом центре в то же время суток эту ошибку не исправит: она заложена не в размере выборки, а в способе (месте и времени) её сбора.

Пример 3 (сложный). Банк строит модель кредитного скоринга — она должна предсказывать вероятность дефолта (невозврата кредита) по заявке клиента. Модель обучают только на клиентах, которым кредит был одобрен в прошлом, потому что только для них известен фактический исход (вернул или не вернул). Всего было $800$ заявок: $500$ одобрено, из них дефолт случился у $4\%$ ($20$ человек); $300$ отклонено — и для них истинный исход, конечно, никогда не наблюдался. Предположим (это гипотетическая, но правдоподобная оценка, которую можно получить, например, из данных других банков с более мягкой политикой), что если бы всем $300$ отклонённым тоже выдали кредит, дефолт случился бы у $22\%$ из них — то есть у $66$ человек. Сравни наблюдаемую (по одобренным) и истинную (по всем заявителям) долю дефолтов.

Наблюдаемая доля дефолтов, которую видит модель при обучении (только среди одобренных):

$$\hat{p}_{\text{наблюдаемая}} = \frac{20}{500} = 0{,}04 = 4\%.$$

Истинная доля дефолтов среди всех заявителей, если бы кредит выдавали всем:

$$p_{\text{истинная}} = \frac{20+66}{800} = \frac{86}{800} = 0{,}1075 = 10{,}75\%.$$

Разница колоссальная: модель, обученная только на одобренных клиентах, видит мир, где дефолт — редкость ($4\%$), хотя в реальности среди всех, кто мог бы претендовать на кредит, дефолт почти в три раза более вероятен ($10{,}75\%$). Это классический пример смещения выживших в применении к скорингу — в индустрии кредитования эта проблема известна как «проблема учёта отклонённых заявок», и полностью аналогичных механизмов работы модель просто никогда не увидит: она обучена делать выводы только о той узкой подгруппе клиентов, которая уже прошла первичный отбор человеком или прошлой версией самой модели.

Почему это важно. Смещённая выборка в машинном обучении — это прямой родственник проблемы, которую называют утечкой данных в широком смысле: и там, и там модель на этапе обучения и проверки видит картину, систематически отличающуюся от той, что она встретит в проде, и метрики на тестовой выборке начинают лгать о реальном качестве модели. Классическая утечка данных возникает, когда в признаки просачивается информация из будущего или напрямую связанная с целевой переменной; смещённая выборка — более широкое и часто менее заметное явление: сами объекты, на которых обучена и проверена модель, — это не случайный срез генеральной совокупности, на которой модель будет работать. Итог одинаковый в обоих случаях: модель показывает отличные метрики на тесте и заметно хуже работает в проде. Разница лишь в механизме — не «подсмотренный» признак, а «подсмотренная», нерепрезентативная выборка объектов.


Выборочные статистики и поправка Бесселя

Интуиция: линейка, которой ты меришь неизвестную величину

У генеральной совокупности есть свои, фиксированные, но чаще всего неизвестные тебе числовые характеристики — истинное среднее $\mu$ и истинная дисперсия $\sigma^2$. Ты никогда не видишь эти числа напрямую (иначе не нужна была бы вся статистика) — ты видишь только выборку и по ней оцениваешь эти параметры. Величины, которые ты вычисляешь по выборке и используешь как оценку параметров генеральной совокупности, называются выборочными статистиками. Выборочное среднее $\bar{X}$ — это оценка истинного среднего $\mu$. Выборочная дисперсия $S^2$ — это оценка истинной дисперсии $\sigma^2$. Ключевое слово — «оценка»: каждая конкретная выборка даёт своё, слегка отличающееся от других выборок значение, а значит выборочная статистика — сама по себе случайная величина, распределённая вокруг истинного параметра (к строгой теории оценок мы вернёмся в следующем уроке).

Определение: Пусть $X_1, X_2, \dots, X_n$ — независимые наблюдения (выборка) из генеральной совокупности со средним $\mu$ и дисперсией $\sigma^2$. Выборочное среднее:

$$\bar{X} = \frac{1}{n}\sum_{i=1}^{n} X_i.$$

Выборочная дисперсия (с поправкой Бесселя):

$$S^2 = \frac{1}{n-1}\sum_{i=1}^{n} (X_i - \bar{X})^2.$$

Формула выборочного среднего интуитивно понятна — это обычное арифметическое среднее по выборке. А вот формула выборочной дисперсии почти наверняка вызывает вопрос: почему в знаменателе стоит $n-1$, а не более привычное $n$, как в формуле дисперсии по определению? Разберёмся с этим по-честному, а не просто примем как данность.

Представь, что ты вместо истинного (но неизвестного) среднего $\mu$ вынужден использовать выборочное среднее $\bar{X}$ — то самое число, которое ты только что вычислил по этой же выборке. У выборочного среднего есть одно замечательное (и здесь коварное) свойство: сумма квадратов отклонений от $\bar{X}$ всегда не больше суммы квадратов отклонений от любого другого числа, включая истинное $\mu$ — потому что именно $\bar{X}$ минимизирует сумму $\sum (X_i - a)^2$ по всем возможным $a$. Раз $\bar{X}$ подбирается так, чтобы «подстроиться» именно под эту конкретную выборку, сумма квадратов отклонений от $\bar{X}$ оказывается систематически меньше, чем была бы сумма квадратов отклонений от истинного $\mu$. Если просто поделить эту заниженную сумму на $n$, результат в среднем окажется меньше истинной дисперсии $\sigma^2$ — оценка получится смещённой (систематически заниженной).

Покажем это строго. Есть полезное алгебраическое тождество:

$$\sum_{i=1}^{n} (X_i - \bar{X})^2 = \sum_{i=1}^{n} (X_i - \mu)^2 - n(\bar{X} - \mu)^2.$$

Возьмём математическое ожидание обеих частей. Первое слагаемое справа: $\mathbb{E}\left[\sum (X_i-\mu)^2\right] = n\sigma^2$, поскольку каждое слагаемое в среднем равно $\sigma^2$ по определению дисперсии. Второе слагаемое: $\mathbb{E}[(\bar X - \mu)^2] = \mathrm{Var}(\bar X) = \dfrac{\sigma^2}{n}$ (эту формулу дисперсии среднего ты уже встречал в уроке про закон больших чисел), значит $\mathbb{E}[n(\bar X-\mu)^2] = \sigma^2$. Собираем вместе:

$$\mathbb{E}\left[\sum_{i=1}^{n} (X_i-\bar X)^2\right] = n\sigma^2 - \sigma^2 = (n-1)\sigma^2.$$

Вот и всё объяснение: сумма квадратов отклонений от выборочного среднего в среднем равна не $n\sigma^2$, а $(n-1)\sigma^2$ — она «недобирает» ровно один множитель $\sigma^2$, потому что одна степень свободы данных уже «потрачена» на вычисление самого $\bar X$ из этой же выборки. Чтобы компенсировать это занижение и получить оценку, которая в среднем совпадает с истинным $\sigma^2$, нужно делить не на $n$, а именно на $n-1$:

$$\mathbb{E}[S^2] = \mathbb{E}\left[\frac{1}{n-1}\sum_{i=1}^n (X_i-\bar X)^2\right] = \frac{(n-1)\sigma^2}{n-1} = \sigma^2.$$

Эта поправка — уменьшение делителя на единицу — называется поправкой Бесселя, в честь немецкого астронома и математика Фридриха Бесселя, впервые формально обосновавшего её в XIX веке. Интуитивная формулировка, которую стоит запомнить: выборочное среднее $\bar X$ всегда «подгоняется» под конкретную выборку чуть лучше, чем это сделало бы истинное $\mu$, поэтому разброс данных вокруг $\bar X$ выглядит немного меньше, чем разброс вокруг $\mu$ на самом деле, — и деление на $n-1$ вместо $n$ восстанавливает справедливость.

Примеры с разбором

Пример 1 (лёгкий). Пять учеников получили за контрольную работу баллы: $70, 75, 80, 85, 90$. Найди выборочное среднее и выборочную дисперсию (с поправкой Бесселя).

Выборочное среднее:

$$\bar X = \frac{70+75+80+85+90}{5} = \frac{400}{5} = 80.$$

Отклонения от среднего: $-10, -5, 0, 5, 10$; их квадраты: $100, 25, 0, 25, 100$; сумма квадратов: $250$. Выборочная дисперсия при $n=5$, делитель $n-1=4$:

$$S^2 = \frac{250}{4} = 62{,}5.$$

Выборочное стандартное отклонение: $S = \sqrt{62{,}5} \approx 7{,}91$ балла.

Пример 2 (средний). Для тех же данных из примера 1 сравни выборочную дисперсию, посчитанную «неправильно» — с делителем $n$ вместо $n-1$ — с корректной выборочной дисперсией, и найди отношение между ними.

Сумма квадратов отклонений та же самая, $250$. При делении на $n=5$ вместо $n-1=4$ получаем смещённую (заниженную) оценку:

$$S_n^2 = \frac{250}{5} = 50.$$

Сравним с корректным значением из примера 1, $S^2 = 62{,}5$. Отношение:

$$\frac{S_n^2}{S^2} = \frac{50}{62{,}5} = 0{,}8 = \frac{n-1}{n} = \frac{4}{5}.$$

Отношение в точности совпадает с теоретическим коэффициентом смещения $\dfrac{n-1}{n}$, выведенным выше. Для маленьких выборок (как здесь, $n=5$) эта разница заметна — целых $20\%$ занижения. С ростом $n$ отношение $\dfrac{n-1}{n}$ стремится к единице, и разница между «поделить на $n$» и «поделить на $n-1$» становится всё менее заметной — но при малых $n$, характерных, например, для отдельных фолдов кросс-валидации на небольших датасетах, эта разница может ощутимо влиять на результат.

Пример 3 (сложный). Проверим поправку Бесселя не по формуле, а прямым перебором — полным доказательством на игрушечном примере. Пусть генеральная совокупность — это распределение, принимающее три значения $2, 4, 6$ с равными вероятностями $\dfrac13$ каждое. Найдём истинные $\mu$ и $\sigma^2$, а затем возьмём все возможные независимые выборки размера $n=2$ (с повторением — представь, что из этой генеральной совокупности каждый раз заново, независимо, «вытягивают» одно из трёх значений) и убедимся, что среднее по всем таким выборкам от $S^2_{n-1}$ в точности совпадает с $\sigma^2$, а от $S_n^2$ — нет.

Истинное среднее генеральной совокупности:

$$\mu = \frac{2+4+6}{3} = 4.$$

Истинная дисперсия:

$$\sigma^2 = \frac{(2-4)^2+(4-4)^2+(6-4)^2}{3} = \frac{4+0+4}{3} = \frac{8}{3} \approx 2{,}667.$$

Теперь переберём все $3 \times 3 = 9$ равновероятных упорядоченных пар $(X_1, X_2)$, независимо принимающих значения из $\{2,4,6\}$, и для каждой пары посчитаем сумму квадратов отклонений от выборочного среднего этой пары, $\mathrm{SS} = (X_1-\bar X)^2+(X_2-\bar X)^2$:

Пара $\bar X$ $\mathrm{SS}$
$(2,2)$ $2$ $0$
$(2,4)$ $3$ $2$
$(2,6)$ $4$ $8$
$(4,2)$ $3$ $2$
$(4,4)$ $4$ $0$
$(4,6)$ $5$ $2$
$(6,2)$ $4$ $8$
$(6,4)$ $5$ $2$
$(6,6)$ $6$ $0$

Сумма $\mathrm{SS}$ по всем $9$ парам: $0+2+8+2+0+2+8+2+0 = 24$. Среднее значение $\mathrm{SS}$ по всем выборкам: $\dfrac{24}{9} = \dfrac{8}{3}$.

Теперь сравним два способа оценки дисперсии. При делении на $n=2$ (неправильно, смещённая оценка):

$$\mathbb{E}[S_n^2] = \frac{1}{2}\cdot\frac{8}{3} = \frac{4}{3} \approx 1{,}333.$$

Это значение заметно меньше истинной дисперсии $\sigma^2 = \dfrac83 \approx 2{,}667$ — ровно та систематическая недооценка, о которой шла речь выше. Проверим, что это совпадает с теоретической формулой $\mathbb{E}[S_n^2] = \sigma^2 \cdot \dfrac{n-1}{n} = \dfrac83 \cdot \dfrac12 = \dfrac43$ ✓.

При делении на $n-1=1$ (поправка Бесселя):

$$\mathbb{E}[S^2] = \frac{1}{1}\cdot\frac{8}{3} = \frac{8}{3} \approx 2{,}667.$$

Это в точности совпадает с истинной дисперсией генеральной совокупности $\sigma^2 = \dfrac83$! Ни приближённо, ни «почти» — а ровно, до последней цифры. Это не совпадение: именно ради такого точного совпадения в среднем и придумана поправка Бесселя, и полный перебор на игрушечном примере — самый честный способ увидеть, что формула действительно работает, а не просто выглядит правдоподобно.

Почему это важно. Каждый раз, когда код вызывает np.var(), pandas.Series.var() или numpy.std(), важно понимать, какой делитель используется. По умолчанию numpy.var() делит на $n$ (это годится, если ты действительно располагаешь целой генеральной совокупностью, а не выборкой из неё), тогда как pandas.Series.var() по умолчанию использует поправку Бесселя, деля на $n-1$ (потому что pandas по умолчанию предполагает, что перед тобой выборка). Незнание этой разницы — источник тихих, трудноуловимых ошибок: например, при ручном пересчёте статистик внутри своей функции метрики или при малых объёмах данных на одном фолде кросс-валидации, где разница между $n$ и $n-1$ особенно заметна.


Практика: 30 заданий

Базовые (задания 1–10)

Задание 1. Ресторанная сеть хочет узнать удовлетворённость своих $5000$ посетителей за прошлый год и раздаёт анкету $200$ случайно выбранным посетителям. Укажи генеральную совокупность, выборку и их размеры.


Задание 2. Найди выборочное среднее для данных: $4, 6, 8, 10, 12$.


Задание 3. Для тех же данных ($4, 6, 8, 10, 12$) найди выборочную дисперсию с поправкой Бесселя.


Задание 4. Для тех же данных сравни выборочную дисперсию с делителем $n$ и с делителем $n-1$.


Задание 5. Компания опрашивает посетителей у входа в фитнес-клуб об их отношении к спорту, чтобы оценить отношение к спорту среди населения города в целом. Является ли эта выборка смещённой? Обоснуй.


Задание 6. Генеральная совокупность состоит из $100$ объектов. Из неё простой случайной выборкой отбирают $10$ объектов. Какова вероятность попадания в выборку для конкретного, заранее выбранного объекта?


Задание 7. В компании $800$ сотрудников: $600$ женщин и $200$ мужчин. Отдел кадров хочет опросить $100$ человек, используя стратифицированную выборку, сохраняющую пропорции по полу. Сколько женщин и сколько мужчин должно попасть в выборку?


Задание 8. В датасете $1000$ объектов, из них $5\%$ (то есть $50$ объектов) относятся к положительному классу. Из датасета случайно отбирают тестовую выборку размером $200$ объектов. Сколько объектов положительного класса ожидается в тестовой выборке?


Задание 9. Компания хочет построить модель, предсказывающую поведение всех своих текущих и будущих клиентов. Для обучения используются исторические данные о $15\,000$ прошлых клиентов. Опиши, что здесь является генеральной совокупностью и почему она не может быть полностью пронаблюдана.


Задание 10. Интернет-магазин рассылает анкету оценки качества обслуживания только тем клиентам, которые уже совершили покупку. В какую сторону смещена такая выборка относительно всех посетителей сайта?


Средние (задания 11–20)

Задание 11. Найди выборочную дисперсию (с поправкой Бесселя) для данных: $12, 15, 14, 10, 18, 20, 13, 16$.


Задание 12. Для $10$ измерений цены товара (в условных единицах): $100, 102, 98, 101, 99, 103, 97, 104, 96, 100$ найди выборочное среднее и выборочную дисперсию.


Задание 13. Истинная структура населения: $70\%$ работающих со средним доходом $60\,000$ рублей, $30\%$ неработающих со средним доходом $20\,000$ рублей. Опрос, проведённый в торговом центре днём в будни, захватывает только $20\%$ работающих и $80\%$ неработающих. Найди истинный средний доход и оценку по смещённой выборке.


Задание 14. По официальной статистике города, среди владельцев телефонов кандидата А поддерживают $70\%$, среди тех, у кого телефона нет, — $40\%$. Владельцы телефонов составляют $60\%$ населения. Найди истинную долю сторонников кандидата А в населении и сравни её с оценкой, полученной телефонным опросом (который охватывает только владельцев телефонов).


Задание 15. Известно, что истинная дисперсия генеральной совокупности $\sigma^2 = 25$. Если бы кто-то по ошибке считал выборочную дисперсию с делителем $n$ вместо $n-1$ при $n=5$, каким было бы математическое ожидание такой (смещённой) оценки?


Задание 16. Известное стандартное отклонение генеральной совокупности $\sigma = 4$. Найди стандартную ошибку выборочного среднего для выборок размером $n=16$ и $n=64$, и сравни их.


Задание 17. В датасете для классификации $500$ объектов трёх классов: $400$ класса A, $80$ класса B, $20$ класса C. При случайной выборке размером $50$ объектов найди ожидаемое число объектов каждого класса.


Задание 18. Дата-сайентист сначала масштабирует (нормализует) весь датасет целиком (вычисляя среднее и стандартное отклонение по всем данным), а только потом разбивает его на обучающую и тестовую выборки. Объясни, почему это нарушает принцип «тестовая выборка представляет генеральную совокупность, о которой ничего не известно на момент обучения».


Задание 19. В A/B-тесте пользователей сайта случайным образом делят на две группы: группе А показывают старый дизайн, группе Б — новый. Объясни, почему именно случайное (а не, например, по алфавиту имени) разделение гарантирует, что обе группы можно считать репрезентативными выборками из одной и той же генеральной совокупности пользователей.


Задание 20. Генеральная совокупность из $1000$ клиентов делится на три страты: $733$, $190$ и $77$ клиентов. Нужно построить стратифицированную выборку общим размером $100$. Найди пропорциональные размеры каждой страты в выборке, округли до целых чисел так, чтобы сумма осталась равной $100$.


Продвинутые (задания 21–30)

Задание 21. Генеральная совокупность принимает значения $1, 2, 3$ с равными вероятностями $\dfrac13$ каждое. Переберите все $9$ независимых пар $(X_1,X_2)$ (выборки размера $n=2$ с повторением) и убедитесь, что среднее по всем выборкам от выборочной дисперсии с поправкой Бесселя совпадает с истинной дисперсией генеральной совокупности.


Задание 22. В датасете $1000$ объектов, из которых редкий класс составляет $4\%$ ($40$ объектов). Случайная тестовая выборка — $50$ объектов. Оцени (через биномиальное приближение) вероятность того, что ни одного объекта редкого класса не попадёт в тестовую выборку.


Задание 23. На складе партия из $20$ деталей, среди которых $5$ бракованных. Инспектор случайно (без возвращения) выбирает $5$ деталей для проверки. Найди точную вероятность того, что среди проверенных деталей не окажется ни одной бракованной, используя формулу гипергеометрического распределения.


Задание 24. Банк рассматривал $800$ заявок на кредит: $500$ одобрено (наблюдаемый дефолт среди них $4\%$), $300$ отклонено. Если бы отклонённым заявителям тоже выдали кредит, истинная доля дефолтов среди них составила бы $22\%$. Сравни наблюдаемую долю дефолтов (только по одобренным) с истинной долей дефолтов по всем заявителям.


Задание 25. В опросе о готовности купить новую функцию продукта приняли участие $400$ случайно отобранных пользователей, из них $220$ ответили «да» ($55\%$). Найди стандартную ошибку доли и построй грубый ($\pm 2\,\mathrm{SE}$) интервал вокруг оценки.


Задание 26. Крупная технологическая компания обучила систему отбора резюме на исторических данных о найме за $10$ лет, в течение которых на технические позиции нанимали преимущественно мужчин из-за исторически сложившегося гендерного дисбаланса в отрасли. Система начала занижать оценки резюме, где встречалось слово «женский» (например, «капитан женской шахматной команды»). Определи, в чём здесь генеральная совокупность, выборка, и какой вид смещения сыграл ключевую роль.


Задание 27. Текущий размер выборки в исследовании — $n=100$, и это даёт определённую стандартную ошибку. Во сколько раз нужно увеличить размер выборки, чтобы уменьшить стандартную ошибку ровно в $2$ раза? Приведи итоговый размер выборки.


Задание 28. Исследователь вместо простой случайной выборки использует кластерную: сначала случайно выбирает $5$ школ из $50$ в городе, а затем опрашивает всех учеников только в этих $5$ школах. Объясни, почему такая выборка обычно менее репрезентативна, чем простая случайная выборка того же итогового размера, даже если отбор школ был честно случайным.


Задание 29. В датасете $5000$ транзакций, редкий класс мошенничества составляет $3\%$ ($150$ случаев). Тестовая выборка при случайном разбиении — $60$ транзакций. Оцени вероятность того, что среди них не окажется ни одной мошеннической.


Задание 30. Дата-сайентист строит модель предсказания оттока клиентов. Обучающие данные собраны только среди клиентов, которые сами обратились в поддержку за последний год (остальные клиенты в датасет не попали). Кроме того, при ручном пересчёте дисперсии признаков внутри каждого фолда кросс-валидации в коде по ошибке используется делитель $n$ вместо $n-1$. Назови обе проблемы и объясни, к каким последствиям приведёт каждая из них.


Частые ошибки

Ошибка: «Чем больше размер выборки, тем она надёжнее и репрезентативнее» ✅ Правильно: Размер выборки уменьшает случайную ошибку (разброс от выборки к выборке), но никак не устраняет систематическую ошибку отбора — большая смещённая выборка может быть хуже маленькой случайной 💡 Почему: История Literary Digest — прямое тому доказательство: $2{,}4$ миллиона ответов дали катастрофически неверный прогноз именно потому, что способ сбора данных, а не их количество, определял качество вывода.

Ошибка: «Если у меня есть весь доступный мне датасет, значит я работаю с генеральной совокупностью, а не с выборкой» ✅ Правильно: Датасет почти всегда остаётся выборкой из более широкой генеральной совокупности — включающей будущие, ещё не собранные данные, — даже если он кажется исчерпывающим на сегодняшний день 💡 Почему: Модель, обученная на «всех данных на сегодня», всё равно должна будет работать на данных завтрашнего дня, которые физически не могли попасть в обучающий датасет — значит, сегодняшний датасет по определению является выборкой из совокупности, включающей будущее.

Ошибка: «Случайная выборка гарантирует, что моя конкретная выборка точно репрезентативна» ✅ Правильно: Случайная выборка гарантирует отсутствие систематического смещения в среднем по всем возможным выборкам, но конкретная реализация всё равно может случайно отклониться от истинных пропорций генеральной совокупности 💡 Почему: Случайность — это про отсутствие направленного перекоса, а не про отсутствие любых колебаний. Именно поэтому для сильно несбалансированных данных используют стратификацию — она уменьшает именно этот случайный разброс, а не заменяет случайность отбора.

Ошибка: «Выборочная дисперсия с делителем $n$ и с делителем $n-1$ — это, по сути, одно и то же, разница не важна» ✅ Правильно: Делитель $n$ даёт смещённую (систематически заниженную) оценку дисперсии генеральной совокупности, делитель $n-1$ (поправка Бесселя) — несмещённую; разница особенно ощутима при малых $n$ 💡 Почему: Выборочное среднее $\bar X$ всегда чуть лучше «подгоняется» к конкретной выборке, чем истинное $\mu$, из-за чего сумма квадратов отклонений от $\bar X$ систематически меньше суммы квадратов отклонений от $\mu$ — это доказывается точно, а не приблизительно, и подтверждается прямым перебором (задания 21 и «Пример 3» из раздела про поправку Бесселя).

Ошибка: «Модель кредитного скоринга, обученная на одобренных заявках, объективно оценивает риск дефолта для всех потенциальных заёмщиков» ✅ Правильно: Модель, обученная только на одобренных заявках, систематически недооценивает риск, потому что никогда не видела исходов по отклонённым заявителям — это проблема смещения выживших, известная как проблема учёта отклонённых заявок 💡 Почему: Исход (вернул или нет) наблюдается только для тех, кому кредит уже выдали, — а решение о выдаче само по себе уже было основано на предварительной оценке риска, поэтому одобренная выборка систематически «лучше» всей популяции заявителей.

Ошибка: «Раз в выборке случайно оказался небольшой процент редкого класса, значит доля этого класса в генеральной совокупности тоже небольшая — можно её игнорировать» ✅ Правильно: Малая доля класса в выборке отражает малую долю в генеральной совокупности только при условии, что выборка репрезентативна; при этом даже репрезентативная, но небольшая выборка может случайно вообще не содержать примеров редкого класса 💡 Почему: Как показано в заданиях 22 и 29, вероятность полностью «потерять» редкий класс при случайном разбиении легко может составлять $13$–$16\%$ и больше — это не редкость, а обычный побочный эффект малых выборок при работе с несбалансированными данными.


Главное запомнить

Генеральная совокупность — всё множество объектов, которое интересует исследователя (обозначается $N$, часто бесконечно или неизвестно); выборка — доступное, реально наблюдаемое подмножество ($n \ll N$)

✅ В машинном обучении генеральная совокупность — это, по сути, всё распределение $p(\mathbf{x}, y)$, включая данные, которые ещё не существуют; тренировочный и тестовый датасеты — это выборки из этого распределения

Репрезентативность — соответствие распределения признаков в выборке распределению признаков в генеральной совокупности; это свойство выборки в целом, а не отдельного объекта

Случайная выборка — способ отбора, при котором каждый объект генеральной совокупности имеет равную вероятность $\dfrac nN$ попасть в выборку; она устраняет систематическое смещение, но не устраняет случайный разброс конкретной реализации

Смещённая выборка (систематическая ошибка отбора) возникает, когда вероятность попадания объекта в выборку связана с изучаемым признаком; в отличие от случайной ошибки, она не уменьшается с ростом $n$

✅ Классический исторический пример смещённой выборки — провал прогноза журнала Literary Digest в 1936 году: огромная выборка ($2{,}4$ млн ответов), но систематически смещённая рамка отбора (телефоны и автомобили как признак состоятельности)

✅ Смещённая выборка в машинном обучении напрямую связана с проблемой утечки данных и разрывом между качеством на тесте и качеством в проде: модель хорошо работает на нерепрезентативных данных, но плохо — на реальном потоке

Выборочное среднее $\bar X = \dfrac1n\sum X_i$ — несмещённая оценка $\mu$; выборочная дисперсия $S^2=\dfrac{1}{n-1}\sum(X_i-\bar X)^2$ — несмещённая оценка $\sigma^2$

✅ Делитель $n-1$ (поправка Бесселя) нужен потому, что выборочное среднее $\bar X$ всегда чуть точнее «подгоняется» под конкретную выборку, чем истинное $\mu$, из-за чего наивная формула с делителем $n$ систематически занижает дисперсию

✅ Стандартная ошибка среднего $\mathrm{SE}=\sigma/\sqrt n$ убывает медленно — чтобы уменьшить её вдвое, размер выборки нужно увеличить вчетверо


Связь с другими темами курса

🔙 Откуда пришли: Из урока 244 — ковариация и корреляция как способ измерить связь между переменными по выборочным данным; из урока 243 — совместные и условные распределения как язык, на котором формулируется генеральная совокупность $p(\mathbf{x}, y)$; из уроков про закон больших чисел и центральную предельную теорему — обоснование того, почему выборочные статистики вообще приближаются к истинным параметрам с ростом $n$

🔜 Куда идём:

  • Оценка параметров (урок 246) — систематическая теория того, что значит «хорошая» оценка: несмещённость, состоятельность, эффективность, метод максимального правдоподобия
  • Доверительные интервалы и проверка статистических гипотез — прямое продолжение идеи стандартной ошибки выборочного среднего, встреченной в этом уроке
  • Кросс-валидация в машинном обучении — техника, которая многократно повторяет разбиение на выборку и «проверочную генеральную совокупность» внутри одного датасета, чтобы честно оценить обобщающую способность модели

🎯 В машинном обучении: Разбиение на обучающую, валидационную и тестовую выборки — это ровно построение (в идеале) случайных, репрезентативных выборок из одной генеральной совокупности данных; проблема смещённой выборки — прямая причина расхождения между метриками на тесте и реальным качеством в проде; поправка Бесселя используется по умолчанию почти во всех библиотеках статистики (pandas, scipy.stats) при подсчёте дисперсии и стандартного отклонения по датасету, потому что эти данные почти всегда рассматриваются как выборка, а не как полная генеральная совокупность


Интересные факты

📌 Провал Literary Digest в 1936 году не просто ошибка — он стал причиной рождения современной индустрии социологических опросов: Джордж Гэллап, точно предсказавший исход на несравнимо меньшей, но тщательно подобранной выборке, основал компанию, которая под его именем работает и сегодня.

📌 Слово «репрезентативный» происходит от латинского repraesentare — «представлять, делать присутствующим»: репрезентативная выборка в буквальном смысле «представляет» генеральную совокупность в её отсутствие, как депутат представляет своих избирателей.

📌 Поправка Бесселя названа в честь немецкого математика и астронома Фридриха Вильгельма Бесселя, более известного благодаря функциям Бесселя из математической физики; вклад в статистику — лишь небольшой эпизод в его карьере, посвящённой в основном небесной механике и геодезии.

📌 Проблема учёта отклонённых заявок в кредитном скоринге остаётся нерешённой в полной мере и сегодня: банки пытаются оценивать риск для отклонённых заявителей косвенными методами — например, выдавая небольшой процент заведомо рискованных кредитов случайно выбранным заявителям исключительно ради сбора непредвзятых статистических данных.


Лайфхаки и полезные трюки

💡 Прежде чем доверять любой метрике или статистике, задай себе вопрос: «А как именно были собраны эти данные?» Если ответ содержит слова вроде «только те, кто сам откликнулся», «только успешные случаи», «только одобренные заявки» — скорее всего, перед тобой смещённая выборка, и никакой объём данных это не исправит.

💡 При работе с train_test_split в scikit-learn всегда указывай параметр stratify=y для классификационных задач с несбалансированными классами — это гарантирует сохранение пропорций классов и в обучающей, и в тестовой выборке, устраняя риск случайно «потерять» редкий класс, о котором шла речь в заданиях 22 и 29.

💡 Все шаги предобработки, которые требуют статистик по данным (масштабирование, заполнение пропусков средним, отбор признаков по корреляции с целью), нужно подбирать только по обучающей выборке, а затем применять готовые параметры к тестовой — иначе тестовая выборка перестаёт быть честным приближением к неизвестной генеральной совокупности.

💡 Если сомневаешься, использовать ли делитель $n$ или $n-1$ при расчёте дисперсии вручную, задай себе простой вопрос: «У меня действительно вся генеральная совокупность или только выборка из неё?» В подавляющем большинстве практических задач с данными — это выборка, значит нужен $n-1$; библиотека pandas использует его по умолчанию именно поэтому.

💡 При проектировании сбора данных для новой модели заранее продумай, какая генеральная совокупность тебе на самом деле нужна, и составь план, как получить из неё случайную (а ещё лучше — стратифицированную по ключевым сегментам) выборку, а не просто собирай «что есть под рукой» — самый частый источник смещения в реальных проектах именно такой: данные берут не из тех источников, которые репрезентативны, а из тех, которые технически проще всего достать.

💡 Если размер выборки ограничен и увеличивать его дорого, помни: стандартная ошибка убывает как $\dfrac{1}{\sqrt n}$, а не как $\dfrac1n$ — удвоение точности требует четырёхкратного увеличения выборки, и это стоит учитывать при планировании бюджета на сбор данных или на A/B-тест заранее, а не постфактум.


Каждый раз, когда ты запускаешь train_test_split одной строчкой кода, за этой строчкой стоит именно тот вопрос, с которого начался этот урок: насколько данные, которые у тебя есть, представляют мир, в котором модели предстоит работать. Генеральная совокупность — это цель, выборка — это инструмент её достижения, а весь набор понятий этого урока (репрезентативность, случайный отбор, смещение, выборочные статистики с поправкой на число степеней свободы) — это техника безопасности против самой коварной ошибки в анализе данных: уверенности, что раз число посчиталось, значит оно верно. Число, посчитанное по нерепрезентативной выборке, — это число, отвечающее не на тот вопрос, который ты задал. В следующем уроке ты пойдёшь дальше: научишься строго формулировать, что значит «хорошая» оценка параметра, и оценивать не только среднее и дисперсию, но и куда более сложные величины — но весь этот аппарат имеет смысл только потому, что ты уже понимаешь, чем выборка отличается от того целого, о котором она пытается рассказать.

Понял тему? Закрепи в боте! 🚀

Попрактикуйся на задачах и получи персональные рекомендации от AI

💪 Начать тренировку
💬 Есть вопрос? Спроси бота!