Теоремы о пределах 🧩
В уроке 178 ты научился доказывать существование предела и находить его значение честным путём — через определение, подбирая номер $N$ под каждое $\varepsilon$. Это была необходимая, но болезненная процедура: для каждой новой последовательности приходилось изобретать оценку заново. А реальные выражения почти никогда не бывают одинокой последовательностью — это суммы, произведения и частные нескольких частей сразу. Функция потерь — это сумма члена за данные и члена за регуляризацию. Шаг оптимизатора — это произведение скорости обучения на градиент. Скорость сходимости численного метода — это частное двух последовательных ошибок.
Сегодняшний урок избавляет от необходимости каждый раз возвращаться к определению. Мы докажем небольшой набор теорем, которые превращают «я знаю пределы кусков» в «я знаю предел целого» одним алгебраическим действием — без единого $\varepsilon$. Отдельно разберём теоремы, которые описывают не арифметику, а саму структуру предела: может ли у последовательности быть два разных предела, что происходит со знаком членов рядом с пределом и как связаны ограниченность и сходимость. И завершим теоремой о двух милиционерах — единственным инструментом этого урока, который справляется с выражениями, для которых пределы кусков вообще не существуют по отдельности.
Всё это — не абстрактная гимнастика. Доказательства сходимости стохастического градиентного спуска, анализ расписаний скорости обучения, разложение функции потерь на слагаемые, оценки скорости сходимости численных методов — везде под капотом работают именно эти теоремы, обычно без явной ссылки на них. Понимание того, где именно применяется теорема о частном, а где — теорема о двух милиционерах, отличает человека, который умеет доказывать сходимость, от человека, который умеет только наблюдать за графиком loss на экране.
Давай разберёмся, откуда взялись эти теоремы, а затем докажем и применим каждую.
🎯 Ты узнаешь:
-
Что такое теорема о единственности предела и почему сходящаяся последовательность не может стремиться сразу к двум разным числам
-
Как предел суммы, разности и произведения выражается через пределы слагаемых, и почему для частного обязательно требуется, чтобы предел знаменателя был не равен нулю
-
Что происходит, если знаменатель всё-таки стремится к нулю, и как отличить настоящую неопределённость $\frac{0}{0}$ от случая, когда предела попросту не существует
-
Теорему о сохранении знака и то, как строгое неравенство теряет строгость при переходе к пределу
-
Как ограниченность связана со сходимостью: почему сходящаяся последовательность обязана быть ограниченной, а обратное неверно
-
Теорему о двух милиционерах и то, как ей доказывают пределы, недоступные никаким другим средствам этого урока
-
Как всё это работает при анализе скорости сходимости алгоритмов оптимизации и при упрощении пределов функций потерь в машинном обучении
История: откуда это взялось?
В начале 1820-х годов Огюстен Луи Коши читал анализ будущим инженерам в Политехнической школе Парижа — людям, которым предстояло считать траектории снарядов и прочность мостов, а не любоваться красотой формул. В «Курсе анализа» 1821 года он впервые дал определение предела через язык бесконечно малых величин и, что важнее, впервые по-настоящему доказал, а не просто объявил очевидным, что предел суммы равен сумме пределов, а предел произведения — произведению пределов. До Коши математики XVIII века — Эйлер, братья Бернулли — обращались с бесконечно малыми довольно вольно, что временами приводило к парадоксам вроде «доказательств» абсурдных равенств при работе с расходящимися рядами. Задача Коши была навести порядок: превратить интуитивно понятные операции в утверждения с доказательствами и условиями применимости.
Полную строгость эти теоремы получили позже, в лекциях Карла Вейерштрасса в Берлине 1860-х годов, откуда и пришёл привычный нам язык $\varepsilon$-$\delta$. Именно Вейерштрасс настаивал, что даже «очевидные» факты вроде единственности предела нуждаются в доказательстве из определения, а не в апелляции к интуиции — до него математики нередко путали то, что кажется верным, с тем, что доказано. Теорема о сохранении знака и теорема о единственности предела — ровно такого рода утверждения: интуитивно бесспорные, но требующие аккуратного доказательства, и именно вейерштрассовская школа сделала это стандартом математического образования.
Теорема о двух милиционерах устроена интереснее с точки зрения имени. По-русски она называется «о двух милиционерах» (или «о зажатой последовательности»), по-английски — squeeze theorem или sandwich theorem («сэндвич»), а по-французски — буквально théorème des gendarmes, «теорема о жандармах»: два жандарма ведут задержанного между собой, и куда бы он ни вильнул, он придёт туда же, куда и они. Русское название — прямая калька с французского образа, просто «жандармы» превратились в «милиционеров» при переводе в советской математической традиции (в частности, эту формулировку использовал Григорий Фихтенгольц в своём классическом учебнике). Содержательно теорема встречается уже в «Курсе анализа» Коши, просто без запоминающегося имени: у него это был технический приём для оценки пределов через неравенства, а яркий образ конвоя появился заметно позже, в педагогической традиции XX века.
Единственность и ограниченность предела
Интуиция: у финиша одна линия
Представь, что последовательность — это бегун, приближающийся к финишу. Если он на самом деле сходится к точке $A$, это значит, что начиная с какого-то момента он практически неотличим от $A$: расстояние до неё меньше любого наперёд заданного $\varepsilon$. Но тогда он физически не может одновременно быть неотличим от какой-то другой точки $B \ne A$ — если $A$ и $B$ разные, между ними есть зазор, и бегун не может одновременно стоять в обеих его половинах.
Ограниченность — родственное наблюдение. Если бегун действительно финиширует в точке $A$, то начиная с некоторого номера все его положения лежат в маленьком интервале вокруг $A$. А позиций до этого номера конечное число — среди конечного набора чисел всегда есть самое большое и самое маленькое. Собери эти два факта вместе — и вся последовательность целиком лежит в некотором конечном диапазоне.
Определение и теоремы
Теорема (единственность предела). Если последовательность (или функция) имеет предел, то он единственен: из $\lim_{n \to \infty} a_n = A$ и $\lim_{n \to \infty} a_n = B$ следует $A = B$.
Доказательство. Допустим противное: $A \ne B$. Возьмём $\varepsilon = \frac{|A - B|}{2} > 0$. По определению предела найдётся номер $N_1$, начиная с которого $|a_n - A| < \varepsilon$, и номер $N_2$, начиная с которого $|a_n - B| < \varepsilon$. Для $n > \max(N_1, N_2)$ по неравенству треугольника:
$$|A - B| \le |A - a_n| + |a_n - B| < \varepsilon + \varepsilon = |A - B|$$Получилось, что $|A - B| < |A - B|$ — противоречие. Значит, предположение $A \ne B$ неверно, и $A = B$. $\blacksquare$
Теорема (об ограниченности сходящейся последовательности). Если $\lim_{n \to \infty} a_n = A$, где $A$ — конечное число, то последовательность $(a_n)$ ограничена: существует $M > 0$ такое, что $|a_n| \le M$ для всех $n$.
Доказательство. Возьмём $\varepsilon = 1$. Найдётся номер $N$, начиная с которого $|a_n - A| < 1$, откуда по неравенству треугольника $|a_n| < |A| + 1$. Остаётся конечный набор членов $a_1, \dots, a_N$ — у него, как у любого конечного набора чисел, есть максимум модуля. Полагаем
$$M = \max\{|a_1|, |a_2|, \dots, |a_N|, |A| + 1\}$$Тогда $|a_n| \le M$ для всех $n$ без исключения. $\blacksquare$
Обратное неверно: ограниченность не гарантирует сходимости. Классический контрпример — последовательность $a_n = (-1)^n$. Она ограничена ($|a_n| = 1$ для всех $n$), но не сходится, что легко доказывается через только что доказанную теорему о единственности — от противного.
Разбор примеров
Пример 1 (лёгкий). Дана последовательность $a_n = \dfrac{3n^2 - 1}{n^2 + 2}$. Она сходится к $3$ (в этом легко убедиться, разделив числитель и знаменатель на $n^2$: $\dfrac{3 - 1/n^2}{1 + 2/n^2} \to \dfrac{3 - 0}{1 + 0} = 3$). Построим для неё явную границу по схеме из доказательства.
Оценим $|a_n - 3|$:
$$a_n - 3 = \frac{3n^2 - 1}{n^2+2} - 3 = \frac{3n^2 - 1 - 3n^2 - 6}{n^2+2} = \frac{-7}{n^2+2}$$При $n \ge 1$ выполнено $\left|\dfrac{-7}{n^2+2}\right| \le \dfrac{7}{3} < 1$ уже при $n=1$, а при увеличении $n$ эта величина только убывает. Значит, $|a_n - 3| < 1$ для всех $n \ge 1$, откуда $|a_n| < 4$ для всех $n$. Граница $M = 4$ работает сразу для всей последовательности, даже без разбиения на «начальные члены» и «хвост» — в этом примере оценка получилась особенно чистой.
Пример 2 (средний). Докажи, что последовательность $b_n = n \cdot (-1)^n$ расходится, не используя определение предела напрямую.
Заметим, что $|b_n| = n \to \infty$ — последовательность модулей неограниченно растёт, значит сама $(b_n)$ не ограничена ни для какого $M$: какое бы $M$ мы ни взяли, найдётся $n > M$, и для него $|b_n| = n > M$. По контрапозиции теоремы об ограниченности сходящейся последовательности («сходится $\Rightarrow$ ограничена», значит «не ограничена $\Rightarrow$ не сходится»), последовательность $b_n$ расходится. Ни одной оценки через $\varepsilon$ не понадобилось — только сам факт неограниченности.
Пример 3 (сложный, ML). При обучении нейросети со слишком большой скоростью обучения норма весов $\|\theta_n\|$ иногда начинает неограниченно расти от шага к шагу («loss взорвался», значения превращаются в NaN). Теорема об ограниченности сходящейся последовательности — это ровно та математика, что стоит за диагнозом «обучение разошлось»: если $\|\theta_n\|$ неограничена, то по контрапозиции теоремы последовательность весов не может сходиться ни к какому конечному вектору, и дальнейшее обучение с текущими гиперпараметрами бессмысленно.
Но здесь легко ошибиться и в обратную сторону. Обратное утверждение неверно: то, что loss остаётся в разумных пределах (не улетает в бесконечность), ещё не значит, что обучение сходится. Циклическое расписание скорости обучения (cyclical learning rate) специально держит loss ограниченным, но при этом он колеблется, а не стабилизируется — совсем как $(-1)^n$. Чтобы из ограниченности сделать вывод о сходимости, нужно дополнительное условие — например, монотонность (тогда работает теорема Вейерштрасса о монотонной ограниченной последовательности из урока 178) или критерий Коши. Сама по себе ограниченность такой гарантии не даёт.
Почему это важно
Теорема о единственности избавляет от абсурдного сценария «у этой последовательности два разных предела» — а заодно даёт инструмент доказательства расходимости: если у последовательности нашлись две подпоследовательности с разными пределами, у всей последовательности предела быть не может, никакая другая проверка не нужна. Теорема об ограниченности работает как самый дешёвый тест на расходимость: прежде чем городить оценки через $\varepsilon$, проверь, не улетает ли последовательность в бесконечность — если да, вопрос закрыт немедленно.
Сохранение знака
Интуиция: рядом с пунктом назначения знак уже определён
Представь машину, которая едет к пункту назначения, расположенному строго к востоку от старта. Даже если по пути она петляла и заезжала западнее исходной точки, ближе к концу пути — раз уж она действительно приближается к восточной точке — она обязана оказаться восточнее старта. Так же ведут себя пределы: если предел последовательности строго положителен, то сами члены последовательности, начиная с некоторого номера, тоже обязаны стать строго положительными, какими бы отрицательными они ни были в начале.
Определение и теорема
Теорема (о сохранении знака). Если $\lim_{n \to \infty} a_n = A$ и $A > 0$, то существует номер $N$, начиная с которого $a_n > \dfrac{A}{2} > 0$. Аналогично, если $A < 0$, то существует номер, начиная с которого $a_n < \dfrac{A}{2} < 0$.
Доказательство. Возьмём $\varepsilon = \dfrac{A}{2} > 0$ (это законно, поскольку $A > 0$). По определению предела найдётся $N$, начиная с которого $|a_n - A| < \dfrac{A}{2}$, то есть $A - \dfrac{A}{2} < a_n < A + \dfrac{A}{2}$, откуда $a_n > \dfrac{A}{2} > 0$. $\blacksquare$
Отсюда сразу следует важное следствие о нестрогих неравенствах: если $a_n \ge 0$ для всех $n$ (начиная с некоторого номера) и $\lim a_n = A$, то $A \ge 0$. Доказывается от противного: если бы $A < 0$, теорема о сохранении знака дала бы номер, начиная с которого $a_n < 0$, — противоречие с условием $a_n \ge 0$.
Здесь кроется тонкость, о которую спотыкаются почти все: строгое неравенство при переходе к пределу может превратиться в нестрогое. Из $a_n > 0$ вовсе не следует $A > 0$ — следует только $A \ge 0$. Пример у тебя перед глазами: $a_n = \dfrac{1}{n} > 0$ для всех $n$, но $\lim a_n = 0$, а не число, строго большее нуля.
Более общая версия для двух последовательностей: если $a_n \le b_n$ начиная с некоторого номера, и обе последовательности сходятся, то $\lim a_n \le \lim b_n$ — тоже нестрого, даже если исходное неравенство было строгим.
Разбор примеров
Пример 1 (лёгкий). Дана $a_n = \dfrac{n - 5}{n + 1}$. Она сходится к $1 > 0$ (разделив на $n$: $\dfrac{1 - 5/n}{1 + 1/n} \to 1$). По теореме, начиная с некоторого номера, все члены положительны. Найдём этот номер напрямую: $a_n > 0 \iff n - 5 > 0$ (знаменатель всегда положителен) $\iff n > 5$. Значит, начиная с $n = 6$, все члены строго положительны — теорема гарантировала существование такого номера, а прямое решение неравенства дало его точное значение.
Пример 2 (средний). Дана $a_n = -\dfrac{1}{n^2}$. Все её члены строго отрицательны: $a_n < 0$ для любого $n \ge 1$. Но $\lim_{n\to\infty} a_n = 0$ — предел не отрицателен, он равен нулю. Это ровно тот случай потери строгости, о котором предупреждает теорема: из $a_n < 0$ для всех $n$ следует только $A \le 0$, а не $A < 0$. Студент, ожидающий «раз все члены отрицательны, то и предел отрицателен», ошибается систематически.
Пример 3 (сложный, ML). Пусть $L^*$ — минимальное достижимое значение функции потерь, а $L(\theta_n)$ — значение потерь на шаге $n$ обучения. По определению минимума разрыв $\varepsilon_n := L(\theta_n) - L^* \ge 0$ для абсолютно любого $n$ — это не предположение, а факт из определения $L^*$. Если доказано, что $\varepsilon_n$ сходится к некоторому пределу $\varepsilon^*$, то по следствию из теоремы о сохранении знака сразу получаем $\varepsilon^* \ge 0$ — без единого дополнительного вычисления.
Именно так устроена стандартная архитектура доказательства сходимости к глобальному минимуму в статьях по оптимизации: сначала показывают $\varepsilon^* \ge 0$ этим же аргументом (он тривиален и не требует отдельного анализа алгоритма), а затем отдельно, обычно через теорему о двух милиционерах, доказывают верхнюю оценку $\varepsilon^* \le 0$. Два неравенства вместе дают $\varepsilon^* = 0$, то есть настоящую сходимость к оптимуму. Мы увидим этот же приём в примере на теорему о двух милиционерах чуть ниже — эти две теоремы систематически работают в паре.
Почему это важно
Теорема о сохранении знака — это в буквальном смысле мостик от «предел положителен» к «сами члены положительны» и обратно, причём мостик односторонний: из членов к пределу строгость теряется, а из предела к членам — нет. Понимание этой асимметрии убирает целый класс ошибочных рассуждений и, как ты увидишь в блоке про частное, лежит в основе того, почему деление на предел, равный нулю, вообще требует отдельного разбирательства.
Арифметика пределов: сумма, разность, произведение
Интуиция: конструктор, а не угадайка
Думай о сложном выражении как о конструкторе Lego: если ты точно знаешь, как ведёт себя каждый отдельный кубик, ты можешь собрать из них любую фигуру, зная только правило сборки — а не разбирая всю конструкцию заново для каждого нового набора кубиков. Арифметика пределов — это и есть правило сборки: она позволяет находить предел суммы, разности и произведения, зная только пределы отдельных частей, без единой новой оценки через $\varepsilon$.
Определение и теорема
Теорема (арифметика пределов). Пусть $\lim_{x \to a} f(x) = A$ и $\lim_{x \to a} g(x) = B$, где $A$ и $B$ — конечные числа. Тогда:
$$\lim_{x \to a} [f(x) + g(x)] = A + B, \qquad \lim_{x \to a} [f(x) - g(x)] = A - B$$$$\lim_{x \to a} [f(x) \cdot g(x)] = A \cdot B, \qquad \lim_{x \to a} [c \cdot f(x)] = c \cdot A \quad (c = \text{const})$$
Здесь $x \to a$ понимается в широком смысле: это может быть $x \to a$ для конечного $a$, $x \to \infty$, а частный случай — последовательность, где роль $x$ играет натуральный индекс $n$, а $a$ — символ $\infty$. Всё, что доказывается ниже, работает одинаково в обеих постановках.
Ключевое и часто упускаемое условие: пределы $A$ и $B$ должны существовать заранее — теорема не про то, что предел суммы всегда раскладывается на сумму пределов, а про то, что если оба предела существуют и конечны, то предел суммы существует и равен их сумме. Обратное утверждение — «если сумма сходится, то и слагаемые сходятся по отдельности» — неверно, и мы разберём это в разделе с частыми ошибками.
По индукции теорема распространяется на любое фиксированное конечное число слагаемых и сомножителей: $\lim(f_1 + f_2 + \dots + f_k) = A_1 + A_2 + \dots + A_k$. Слово «фиксированное» здесь принципиально: если число слагаемых само растёт вместе с $n$ (как в частичных суммах ряда), теорема в этом виде уже неприменима — это отдельная большая тема, до которой курс дойдёт в уроке 204.
Идея доказательства (для суммы). По определению предела для любого $\varepsilon > 0$ найдётся $N_1$, что $|f(x) - A| < \varepsilon/2$ при $x$ достаточно близком к $a$, и $N_2$ с тем же для $g$ и $\varepsilon/2$. Тогда для $x$, достаточно близких к $a$ (после обоих номеров):
$$|(f(x)+g(x)) - (A+B)| \le |f(x) - A| + |g(x) - B| < \frac{\varepsilon}{2} + \frac{\varepsilon}{2} = \varepsilon$$Это в точности означает $f(x) + g(x) \to A + B$. Доказательство для произведения устроено похоже, но чуть длиннее технически (использует ограниченность сходящейся $f$, доказанную в предыдущем блоке), и мы не будем выписывать его подробно — идея та же: контролируемая близость каждого куска даёт контролируемую близость целого.
Разбор примеров
Пример 1 (лёгкий). Найти $\lim_{x \to 2} (3x^2 - 5x + 1)$.
Применяем теорему пошагово: предел $x^2$ при $x \to 2$ равен $4$ (произведение $x \cdot x$), значит по теореме о произведении на константу $3x^2 \to 12$; предел $5x \to 10$; по теореме о разности и сумме:
$$\lim_{x \to 2}(3x^2 - 5x + 1) = 12 - 10 + 1 = 3$$Ответ: $3$.
Пример 2 (средний). Даны $a_n = 5 + \dfrac{2}{n}$ и $b_n = 3 - \dfrac{1}{n^2}$, причём $a_n \to 5$, $b_n \to 3$. Найти $\lim_{n\to\infty}(a_n \cdot b_n - 2a_n)$.
По теореме о произведении: $a_n \cdot b_n \to 5 \cdot 3 = 15$. По теореме о произведении на константу: $2a_n \to 10$. По теореме о разности:
$$\lim_{n\to\infty}(a_n b_n - 2a_n) = 15 - 10 = 5$$Ответ: $5$.
Пример 3 (сложный, ML). Расписание скорости обучения $\eta_n = \dfrac{\eta_0}{1 + kn}$ стремится к нулю при $n \to \infty$ (это несложно проверить напрямую: $\eta_n = \dfrac{\eta_0/n}{1/n + k} \to \dfrac{0}{k} = 0$). Предположим также, что норма градиента стабилизируется около остаточного шума и $g_n \to G$ для некоторого конечного $G$ (реалистичный сценарий — обучение застряло около точки с ненулевым «шумовым полом» градиента из-за стохастичности мини-батчей). Найти предел величины обновления параметров $u_n = \eta_n \cdot g_n$.
По теореме о произведении, поскольку оба предела конечны:
$$\lim_{n \to\infty} u_n = \lim_{n\to\infty}\eta_n \cdot \lim_{n\to\infty} g_n = 0 \cdot G = 0$$Ответ: $0$, причём результат не зависит от величины $G$.
Это ровно та математика, которая стоит за интуицией «затухающая скорость обучения гарантирует затухающие обновления, даже если шум в градиенте никуда не денется» — фундаментальная идея условий Роббинса — Монро в теории стохастической аппроксимации.
Почему это важно
Разложение сложной функции потерь на сумму данных-члена и члена регуляризации, шага оптимизатора на произведение скорости обучения и градиента, — типовой ход в анализе алгоритмов оптимизации, и он законен ровно потому, что за ним стоит эта теорема, а не интуитивное «ну наверное можно посчитать по частям». В доказательствах сходимости, публикуемых в статьях по ML, цепочка таких шагов обычно расписывается явно — предел раскладывается на элементарные операции, и на каждом шаге называется применяемая теорема. Это тот же навык, который ты сейчас тренируешь на учебных примерах.
Предел частного и роль условия $M \ne 0$
Интуиция: пицца на исчезающую компанию
Представь, что пиццу делят между гостями поровну. Если число гостей стабилизируется около какого-то положительного значения, размер куска тоже стабилизируется. А если число гостей начинает стремиться к нулю — предел размера куска попросту теряет смысл: он либо неограниченно растёт, либо вопрос становится некорректным. Деление на величину, стремящуюся к нулю, — источник всех неприятностей этого раздела, и именно поэтому у теоремы о частном есть условие, которого нет ни у одной другой теоремы этого урока.
Определение и теорема
Теорема (о пределе частного). Пусть $\lim_{x\to a} f(x) = A$ и $\lim_{x\to a} g(x) = B$, причём $B \ne 0$. Тогда $g(x) \ne 0$ в некоторой проколотой окрестности точки $a$, и
$$\lim_{x\to a} \frac{f(x)}{g(x)} = \frac{A}{B}$$
Обрати внимание: то, что $g(x) \ne 0$ рядом с $a$ (а значит, частное вообще определено), — не отдельное допущение, а следствие теоремы о сохранении знака из предыдущего блока, применённой к $g$: раз $B \ne 0$, начиная с некоторого момента $g(x)$ имеет тот же знак, что и $B$, а значит, не обращается в ноль. Теоремы этого урока опираются друг на друга — это не набор независимых фактов, а цепочка, где каждое следующее звено использует предыдущие.
Что если $B = 0$? Тогда теорема просто не применяется — это не «предел частного равен бесконечности» по умолчанию, а сигнал, что нужен отдельный анализ. Два принципиально разных случая:
-
Если $A \ne 0$, а $B = 0$, конечного предела частного не существует (модуль частного неограниченно растёт, а знак может как стабилизироваться, так и колебаться — это зависит от того, как именно $g$ подходит к нулю).
-
Если $A = 0$ и $B = 0$ одновременно — это неопределённость вида $\frac{0}{0}$: ответ может быть каким угодно (нулём, конечным ненулевым числом, бесконечностью или вообще отсутствовать), и он находится не применением этой теоремы, а алгебраическим преобразованием выражения до перехода к пределу — сокращением общего множителя, умножением на сопряжённое и так далее.
Разбор примеров
Пример 1 (лёгкий). Найти $\lim_{x \to 3} \dfrac{2x + 1}{x - 5}$.
Числитель: $2 \cdot 3 + 1 = 7$. Знаменатель: $3 - 5 = -2 \ne 0$. Условие теоремы выполнено, применяем её напрямую:
$$\lim_{x \to 3} \frac{2x+1}{x-5} = \frac{7}{-2} = -3{,}5$$Ответ: $-3{,}5$.
Пример 2 (средний). Найти $\lim_{x \to -1} \dfrac{x^2 - 1}{x + 1}$.
Подстановка $x = -1$ даёт $\dfrac{0}{0}$ — теорема о частном напрямую неприменима, знаменатель обнуляется. Раскладываем числитель на множители: $x^2 - 1 = (x-1)(x+1)$, и для $x \ne -1$ (а нас интересует именно окрестность, а не сама точка) можно сократить:
$$\frac{x^2-1}{x+1} = \frac{(x-1)(x+1)}{x+1} = x - 1$$Теперь предел вычисляется по теореме о разности напрямую: $\lim_{x\to-1}(x-1) = -1 - 1 = -2$.
Ответ: $-2$. Заметь: неопределённость $\frac{0}{0}$ не означает «предела нет» — она означает «эта конкретная теорема сейчас не работает, ищи другой путь».
Пример 3 (сложный, ML/численные методы). Порядок сходимости итерационного метода часто характеризуют через предел отношения последовательных ошибок $e_n$ (расстояний до точного решения). Пусть метод сходится линейно с ошибкой $e_n = 2 \cdot (0{,}5)^n$. Найти $\lim_{n\to\infty} \dfrac{e_{n+1}}{e_n}$ — константу линейной сходимости.
Заметим, что и числитель $e_{n+1} \to 0$, и знаменатель $e_n \to 0$ — формальная неопределённость $\frac{0}{0}$, теорему о частном напрямую применить нельзя. Но выражение упрощается алгебраически до перехода к пределу:
$$\frac{e_{n+1}}{e_n} = \frac{2 \cdot (0{,}5)^{n+1}}{2\cdot(0{,}5)^n} = 0{,}5$$Отношение оказалось постоянным — тождественно равным $0{,}5$ при каждом $n$, ещё до всякого предельного перехода. Предел константы равен ей самой:
$$\lim_{n\to\infty}\frac{e_{n+1}}{e_n} = 0{,}5$$Ответ: $0{,}5$ — метод сходится линейно с коэффициентом $q = 0{,}5$: на каждом шаге ошибка примерно вдвое уменьшается. Именно так на практике определяют порядок сходимости оптимизационных алгоритмов на сильно выпуклых функциях: сначала упрощают отношение алгебраически, и только потом, когда неопределённость исчезла, применяют теорему о частном к уже упрощённому выражению.
Почему это важно
Это самый частый источник ошибок во всей теме — им посвящён отдельный, первый по счёту, пункт в разделе «Частые ошибки» ниже. Запомни главное правило: прежде чем применять теорему о частном, всегда проверяй предел знаменателя. Если он не ноль — действуй смело, одна строчка. Если ноль — не пытайся «подставить и посмотреть», а ищи алгебраическое преобразование, убирающее проблему до предельного перехода.
Теорема о двух милиционерах
Интуиция: конвой доводит до места, даже если задержанный петляет
Вернёмся к образу из истории урока: два жандарма (или, в русской традиции, милиционера) ведут задержанного между собой к одному и тому же адресу. Если оба конвоира идут к одной и той же точке, задержанный обязан прийти туда же — вне зависимости от того, насколько нерегулярно он вилял по пути. Ключевая ценность этой теоремы именно в последней фразе: она не требует ничего знать про собственное поведение зажатой величины — только про её конвоиров, которые обычно устроены гораздо проще.
Это именно тот инструмент, которого не хватает предыдущим четырём теоремам. Арифметика пределов требует, чтобы у каждого куска выражения был свой предел. Но что делать с $\sin n$, $\cos(n^2)$, $(-1)^n$ или дробной частью числа — у всех этих величин предела попросту не существует, они бесконечно колеблются. Умножить, скажем, $\dfrac{\sin n}{n}$ через теорему о произведении не получится: $\sin n$ предела не имеет. Именно здесь теорема о двух милиционерах вступает в игру — там, где остальные теоремы урока формально неприменимы.
Определение и теорема
Теорема (о двух милиционерах / о промежуточной последовательности или функции). Пусть, начиная с некоторого номера (для последовательностей) или в некоторой проколотой окрестности точки $a$ (для функций), выполнено неравенство
$$a_n \le c_n \le b_n \qquad \text{(соответственно } f(x) \le h(x) \le g(x)\text{)}$$и при этом $\lim a_n = \lim b_n = L$. Тогда $\lim c_n = L$ тоже (аналогично для функций при $x \to a$).
Доказательство. Возьмём произвольное $\varepsilon > 0$. Найдётся номер $N_1$, начиная с которого $a_n > L - \varepsilon$, и номер $N_2$, начиная с которого $b_n < L + \varepsilon$ (это прямое следствие определения предела, применённого к каждой из последовательностей). Для $n > \max(N_1, N_2)$, используя условие $a_n \le c_n \le b_n$:
$$L - \varepsilon < a_n \le c_n \le b_n < L + \varepsilon$$Значит, $L - \varepsilon < c_n < L + \varepsilon$, то есть $|c_n - L| < \varepsilon$. Поскольку $\varepsilon$ было произвольным, это и означает $c_n \to L$. $\blacksquare$
Разбор примеров
Пример 1 (лёгкий). Найти $\lim_{n\to\infty} \dfrac{\sin n}{n}$.
$\sin n$ предела не имеет — теорема о произведении здесь бессильна. Но $\sin n$ ограничен: $-1 \le \sin n \le 1$ для любого $n$. Разделим все части неравенства на $n > 0$ (знак неравенства не меняется):
$$-\frac{1}{n} \le \frac{\sin n}{n} \le \frac{1}{n}$$Обе границы, $-\dfrac1n$ и $\dfrac1n$, стремятся к нулю. По теореме о двух милиционерах, $\dfrac{\sin n}{n} \to 0$.
Ответ: $0$.
Пример 2 (средний). Найти $\lim_{n\to\infty} \dfrac{\lfloor 10n \rfloor}{n}$, где $\lfloor \cdot \rfloor$ — целая часть (пол).
По определению целой части, $10n - 1 < \lfloor 10n \rfloor \le 10n$. Разделим на $n > 0$:
$$10 - \frac{1}{n} < \frac{\lfloor 10n \rfloor}{n} \le 10$$Левая граница стремится к $10$, правая тождественно равна $10$. По теореме о двух милиционерах предел равен $10$.
Ответ: $10$.
Пример 3 (сложный, ML). В анализе сходимости стохастического градиентного спуска типичный промежуточный результат выглядит так: для среднеквадратичного отклонения параметров от оптимума доказана двусторонняя оценка
$$0 \le \mathbb{E}\left[\|\theta_n - \theta^*\|^2\right] \le \frac{C}{n}$$где $C$ — некоторая константа, зависящая от дисперсии шума и параметров задачи, но не от $n$. Определить, сходятся ли параметры к оптимуму в среднеквадратичном смысле.
Нижняя граница — тождественный нуль, верхняя граница $\dfrac{C}{n} \to 0$ при $n \to \infty$. По теореме о двух милиционерах:
$$\lim_{n\to\infty}\mathbb{E}\left[\|\theta_n - \theta^*\|^2\right] = 0$$Ответ: да, сходятся — причём доказательство не требует знать точное распределение $\theta_n$ на каждом шаге, только зажимающую оценку $O(1/n)$. Это ровно та конструкция, которую мы наметили в блоке про сохранение знака: там нижняя граница $\ge 0$ получалась из определения (это разрыв не может быть отрицательным), а здесь верхняя граница $\to 0$ получается из анализа алгоритма — вместе они дают точную сходимость через теорему о двух милиционерах. Это самый частый шаблон доказательства сходимости во всей литературе по стохастической оптимизации, просто обычно записанный без явного упоминания её имени.
Почему это важно
Теорема о двух милиционерах — единственный инструмент этого урока, который не требует, чтобы у зажатой величины был свой закрытый вид или своё аккуратное поведение. В анализе алгоритмов почти никогда не удаётся найти точное выражение для интересующей величины на шаге $n$ — зато почти всегда удаётся зажать её между двумя простыми, явно вычислимыми оценками. Умение увидеть подходящий «конвой» для дикого выражения — навык, который прямо переносится в доказательства оценок сходимости.
Практика: 30 заданий
Базовые задания (1–10)
Задание 1: Даны $\lim_{n\to\infty} a_n = 4$ и $\lim_{n\to\infty} b_n = -3$. Найди $\lim_{n\to\infty}(2a_n + 5b_n)$.
Задание 2: Даны $\lim_{x\to x_0} f(x) = 6$ и $\lim_{x\to x_0} g(x) = 2$. Найди $\lim_{x\to x_0}[f(x)g(x) - 3f(x)]$.
Задание 3: Найди $\lim_{x\to 1}(5x^3 - 2x + 7)$.
Задание 4: Найди $\lim_{x\to -2}\dfrac{3x+4}{x-1}$.
Задание 5: Даны $\lim_{n\to\infty} a_n = 0$ и $\lim_{n\to\infty} b_n = 5$. Найди $\lim_{n\to\infty}\dfrac{a_n}{b_n}$, обосновав применимость теоремы.
Задание 6: Известно, что $\lim_{n\to\infty} a_n = 7$. Докажи, что существует номер $N$, начиная с которого $a_n > 6{,}9$.
Задание 7: Сходится ли последовательность $c_n = (-1)^n \cdot 2$? Обоснуй ответ через теорему единственности предела.
Задание 8: Докажи, что последовательность $a_n = \dfrac{n+1}{n}$ ограничена, указав явную границу.
Задание 9: Найди $\lim_{x\to 3}\dfrac{x^2-9}{x+1}$.
Задание 10: Даны $a_n = 2 + \dfrac1n$ и $b_n = 2 + \dfrac1{n^2}$, обе сходятся к $2$. Найди $\lim_{n\to\infty}(a_n - b_n)$ и сравни с тем, чему равна разность $a_n - b_n$ при конкретном конечном $n$.
Средние задания (11–20)
Задание 11: Найди $\lim_{x\to -1}\dfrac{x^2-1}{x+1}$.
Задание 12: Найди $\lim_{x\to 4}\dfrac{\sqrt{x}-2}{x-4}$.
Задание 13: Найди $\lim_{n\to\infty}\dfrac{3n^2+2n-1}{5n^2-n+4}$.
Задание 14: Найди $\lim_{n\to\infty}\dfrac{(2n-1)(n+3)}{4n^2+1}$.
Задание 15: Найди $\lim_{x\to 0}\dfrac{x^2+3x}{x}$.
Задание 16: Найди $\lim_{n\to\infty}\dfrac{\cos(n^2)}{n+1}$.
Задание 17: Расписание скорости обучения $\eta_n = \dfrac{1}{1+0{,}1n}$, а норма градиента $g_n \to 2$ (стабилизируется на шумовом полу). Найди предел величины обновления $u_n = \eta_n \cdot g_n$.
Задание 18: Полная функция потерь $L_n = D_n + \lambda R_n$, где $D_n \to 0{,}15$ (потери на данных), $R_n \to 0{,}02$ (регуляризация), $\lambda = 0{,}1$ фиксировано. Найди $\lim_{n\to\infty} L_n$.
Задание 19: При каком значении $a$ существует конечный $\lim_{x\to2}\dfrac{x^2+ax-6}{x-2}$? Найди этот предел.
Задание 20: Ошибка алгоритма первого порядка $f_n = \dfrac1n$, ошибка алгоритма второго порядка $e_n = \dfrac1{n^2}$. Найди $\lim_{n\to\infty}\dfrac{e_n}{f_n}$ и объясни, что означает результат.
Продвинутые задания (21–30)
Задание 21: Найди $\lim_{n\to\infty}\dfrac{n!}{n^n}$.
Задание 22: Найди $\lim_{n\to\infty}\left(\dfrac1{n^2+1}+\dfrac1{n^2+2}+\dots+\dfrac1{n^2+n}\right)$ — сумма $n$ слагаемых.
Задание 23: Докажи: если $\lim_{n\to\infty} a_n = A$ и $A \ne 0$, то начиная с некоторого номера $\dfrac1{a_n}$ определено, и $\lim_{n\to\infty}\dfrac1{a_n} = \dfrac1A$.
Задание 24: Пусть $a_n \le b_n$ для всех $n$, обе последовательности сходятся к пределам $A$ и $B$ соответственно. Докажи $A \le B$. Приведи пример, где неравенство между членами строгое ($a_n < b_n$ для всех $n$), но $A = B$.
Задание 25: Ошибка численного метода убывает как $e_n = \dfrac{5}{2^n}$. Проверь, что сходимость линейная, вычислив константу сходимости $q = \lim_{n\to\infty}\dfrac{e_{n+1}}{e_n}$.
Задание 26: Найди $\lim_{n\to\infty}\left(\sqrt{n^2+n}-n\right)$.
Задание 27: Докажи теорему о двух милиционерах из определения предела (запиши полное $\varepsilon$-$N$ доказательство).
Задание 28: При каких значениях $a$ и $b$ выполняется $\lim_{n\to\infty}\left(\sqrt{n^2+an+b}-n\right)=3$?
Задание 29: Скорректированная на смещение оценка второго момента $\hat v_n = \dfrac{v_n}{1-\beta_2^n}$, где сырой момент $v_n \to V$ (конечное число), а $0 < \beta_2 < 1$ — фиксированная константа (как в Adam, обычно $\beta_2 = 0{,}999$). Найди $\lim_{n\to\infty} \hat v_n$.
Задание 30: Дана $a_n = \dfrac{2n+\sin n}{n+1}$. Докажи, что последовательность сходится, найди предел, и укажи номер, начиная с которого $a_n > 1{,}9$.
Частые ошибки
Ошибка 1. Применяют теорему о пределе частного, когда предел знаменателя равен нулю.
Как выглядит: подставляют предельное значение в знаменатель, получают ноль, и всё равно пишут $\lim \frac{f}{g} = \frac{A}{0}$, а дальше либо «предел равен бесконечности», либо просто зависают.
Почему возникает: привычка применять теорему автоматически, не глядя на условие $B \ne 0$, которое стоит в её формулировке.
Как правильно: сначала всегда проверяй предел знаменателя. Если он $\ne 0$ — применяй теорему сразу. Если он равен нулю, различай два случая: если предел числителя тоже ноль, это неопределённость $\frac00$, и нужен алгебраический приём (сократить общий множитель, домножить на сопряжённое) до перехода к пределу; если предел числителя не ноль, конечного предела частного не существует вовсе, и записывать «равно $A/0$» некорректно — это не число.
Ошибка 2. Считают, что если сумма (или произведение) двух последовательностей сходится, то и слагаемые обязаны сходиться по отдельности.
Как выглядит: видят, что $a_n + b_n$ имеет предел, и заключают, что у $a_n$ и $b_n$ тоже есть пределы.
Почему возникает: теорема читается как «если», а хочется прочитать как «тогда и только тогда, если».
Как правильно: теорема о сумме работает только в одну сторону: из существования пределов слагаемых следует существование предела суммы, но не наоборот. Контрпример: $a_n = (-1)^n$, $b_n = -(-1)^n$. Ни $a_n$, ни $b_n$ предела не имеют, а их сумма $a_n+b_n \equiv 0$ сходится тривиально. Прежде чем применять теорему, нужно знать, что пределы слагаемых существуют, — это отдельный факт, который нужно установить заранее, а не вывести из сходимости суммы.
Ошибка 3. Считают, что строгое неравенство между членами последовательности переходит в строгое неравенство между пределами.
Как выглядит: из $a_n > 0$ для всех $n$ делают вывод $\lim a_n > 0$.
Почему возникает: кажется естественным, что строгость должна сохраняться, раз всё остальное «сохраняется по непрерывности».
Как правильно: теорема о сохранении знака и её следствие дают только нестрогое неравенство: $a_n \ge 0$ влечёт $\lim a_n \ge 0$, но не больше. Классический пример — $a_n = \frac1n > 0$ для всех $n$, но $\lim a_n = 0$, не больше нуля.
Ошибка 4. Путают «ограниченная последовательность» с «сходящаяся последовательность».
Как выглядит: доказав ограниченность (|a_n| ≤ M для всех n), сразу пишут «следовательно, последовательность сходится».
Почему возникает: теорема «сходится ⟹ ограничена» запоминается как двусторонняя эквивалентность, хотя это только одна стрелка.
Как правильно: обратное неверно: $a_n = (-1)^n$ ограничена ($|a_n|=1$), но не сходится. Для гарантии сходимости нужно дополнительное условие — например, монотонность (тогда работает теорема Вейерштрасса из урока 178) или критерий Коши. Одна лишь ограниченность сходимость не даёт.
Ошибка 5. Применяют арифметические теоремы предела к бесконечным пределам как к конечным.
Как выглядит: пишут $\infty - \infty = 0$ или $\dfrac{\infty}{\infty} = 1$, ссылаясь на теоремы о разности и частном.
Почему возникает: формулы визуально похожи на арифметику с конечными числами, и хочется подставить символ $\infty$ туда же, куда подставлялось бы конечное число.
Как правильно: все теоремы этого урока сформулированы для конечных пределов $A$ и $B$. Если хотя бы один из пределов бесконечен, эти теоремы неприменимы буквально — нужна отдельная техника (задания 26, 28 в практике — это ровно такие случаи «$\infty-\infty$», решаемые через домножение на сопряжённое, а не подстановкой символа $\infty$ в формулу).
Ошибка 6. Проверяют неравенство $a_n \le c_n \le b_n$ выборочно, на нескольких членах, вместо того чтобы убедиться, что оно выполняется для всех номеров начиная с некоторого.
Как выглядит: «при $n=1,2,3$ неравенство верно, значит теорему о двух милиционерах можно применять».
Почему возникает: проверка на калькуляторе для нескольких значений выглядит достаточно убедительно.
Как правильно: условие теоремы — неравенство должно выполняться для всех $n$, начиная с некоторого фиксированного номера (или для всех точек в проколотой окрестности, если речь о функции), а не для отдельных выбранных значений. Доказывать его нужно как обычное неравенство — алгебраически, для произвольного $n$, а не проверкой на нескольких первых членах.
Главное запомнить
-
Единственность предела: если предел существует, он один. Доказывается от противного через оценку $|A-B| \le |A-a_n|+|a_n-B|$.
-
Ограниченность: сходящаяся последовательность всегда ограничена. Обратное неверно — ограниченность не гарантирует сходимость (пример: $(-1)^n$).
-
Сохранение знака: если $\lim a_n = A > 0$, то $a_n > 0$ (даже $a_n > A/2$) начиная с некоторого номера. Строгость неравенства при обратном переходе — от членов к пределу — может теряться: $a_n>0$ для всех $n$ даёт лишь $A \ge 0$.
-
Арифметика пределов: $\lim(f\pm g) = A \pm B$, $\lim(fg)=AB$, $\lim(cf)=cA$ — при условии, что пределы $A$ и $B$ конечны и существуют заранее, по отдельности.
-
Теорема о частном: $\lim\frac{f}{g}=\frac AB$ работает только при $B \ne 0$; условие $B\ne0$ автоматически гарантирует, что $g$ не обнуляется рядом с точкой, — это следствие теоремы о сохранении знака.
-
Если $B = 0$ и $A \ne 0$ — конечного предела частного нет. Если $B=0$ и $A=0$ — неопределённость $\frac00$, разрешается алгебраическим преобразованием до предельного перехода, а не применением теоремы к исходной форме.
-
Теорема о двух милиционерах: если $a_n \le c_n \le b_n$ и $\lim a_n=\lim b_n=L$, то $\lim c_n=L$. Единственный инструмент урока, работающий даже когда у зажатой величины ($\sin n$, $\cos(n^2)$, дробная часть) вообще нет собственного предела.
-
Все теоремы этого урока сформулированы для конечных пределов. Работа с бесконечными пределами («$\infty-\infty$», «$\infty/\infty$») требует отдельных приёмов — деления на старшую степень, домножения на сопряжённое.
-
Стандартная схема доказательства сходимости к конкретному значению в анализе алгоритмов: нижняя граница $\ge L$ через сохранение знака (часто тривиальна из определения задачи) плюс верхняя граница $\to L$ через теорему о двух милиционерах дают точное равенство пределу $L$.
-
Теоремы урока опираются друг на друга цепочкой: сохранение знака доказывается из определения; на нём базируется корректность теоремы о частном; арифметика сумм и произведений используется внутри доказательства теоремы о двух милиционерах и в разборе примеров каждого блока.
Связь с другими темами курса
Что нужно было знать до этого урока
Весь урок опирается на определение предела последовательности через $\varepsilon$ и $N$ из урока 178 — без него доказательства этого урока превратились бы в необоснованные утверждения. Оттуда же взята теорема Вейерштрасса о монотонной ограниченной последовательности, на которую мы то и дело ссылались при обсуждении границы «ограниченность не даёт сходимость». Из школьной алгебры понадобились приёмы разложения многочлена на множители и умножения на сопряжённое выражение — оба приёма систематически используются, чтобы избавляться от неопределённости $\frac00$ и от формы $\infty - \infty$ прежде, чем применять теоремы этого урока. Понятие функции и её предела в точке (из урока 177, где обсуждались функции и их свойства) даёт язык, в котором формулировки теорем работают одинаково что для последовательностей, что для функций.
Что изучить дальше
Урок 180 «Замечательные пределы» берёт ровно тот случай, когда арифметика этого урока формально неприменима — неопределённости вида $\frac00$ и $\frac{\infty}{\infty}$, которые не удаётся разрешить элементарной алгеброй, — и вводит для них специальные готовые формулы ($\lim \frac{\sin x}{x}=1$ и подобные), которые сами доказываются через теорему о двух милиционерах. Урок 181 «Бесконечно малые и большие» формализует то, что мы делали интуитивно в задачах 26 и 28: арифметику величин, стремящихся к нулю или к бесконечности, включая случаи, где теоремы этого урока (сформулированные только для конечных пределов) неприменимы напрямую. Урок 182 «Сравнение бесконечно малых» развивает именно ту идею, что мы увидели в задаче 20 (сравнение скоростей убывания ошибок разных порядков), доводя её до полноценной техники эквивалентных бесконечно малых. Урок 183 «Непрерывность: строгое определение» покажет, что непрерывность функции — это в точности утверждение о её пределе, и арифметика непрерывных функций (сумма, произведение, частное непрерывных функций непрерывны) — прямое следствие теорем сегодняшнего урока. Гораздо дальше, в уроке 192 «Правило Лопиталя», появится систематический метод раскрытия неопределённостей $\frac00$ и $\frac{\infty}{\infty}$ через производные — там, где алгебраические трюки этого урока (факторизация, сопряжённое) окажутся бессильны. А в уроке 204 «Числовые ряды» аккуратно обсуждается, почему арифметика пределов из этого урока распространяется только на конечное число слагаемых и не работает автоматически для бесконечных сумм.
Где это нужно в жизни
💻 Программирование. Условие остановки итерационного алгоритма |x_{n+1} - x_n| < tol — это прямое использование определения предела и, чаще всего, теоремы о сохранении знака в её практической форме: последовательность разностей должна стабильно уйти ниже порога. Библиотеки scipy.optimize, numpy и любые численные солверы явно проверяют именно это условие внутри цикла.
🤖 ML/AI. Условия Роббинса — Монро для стохастической аппроксимации ($\sum \eta_n = \infty$, $\sum \eta_n^2 < \infty$), доказательства сходимости SGD, Adam и их вариантов, анализ расписаний скорости обучения, разложение функции потерь на слагаемые (data loss + regularization) — везде эти теоремы работают под капотом, обычно без явной ссылки на них по имени. Теорема о двух милиционерах — стандартный инструмент доказательства оценок сходимости вида $O(1/n)$ или $O(1/\sqrt n)$.
📊 Data Science. Стабилизация метрики при увеличении числа фолдов кросс-валидации или числа бутстрэп-выборок — это вопрос «сходится ли последовательность оценок метрики», и решается он ровно тем же аппаратом: проверкой ограниченности и монотонности, оценкой через зажимающие границы.
🔬 Наука. Мгновенная скорость в физике определяется как предел отношения приращения координаты к приращению времени — тема, к которой курс подойдёт в уроке 186 про строгое определение производной, и вся арифметика пределов, разобранная сегодня, там используется напрямую при выводе правил дифференцирования суммы и произведения функций.
💰 Финансы. Непрерывно начисляемый процент определяется как предел последовательности при увеличении числа периодов начисления в году — классическая иллюстрация к «замечательным пределам» урока 180, но сама постановка вопроса («существует ли этот предел, и как его найти через уже известные пределы») — это в точности язык сегодняшнего урока.
Интересные факты
-
Русское название «теорема о двух милиционерах» — перевод-адаптация французского théorème des gendarmes («теорема о жандармах»): образ конвоя, ведущего задержанного между собой к одному и тому же месту, родился во французской педагогической традиции и при переходе в советские учебники превратил жандармов в милиционеров. По-английски прижилось более прозаичное squeeze theorem («теорема сжатия») или sandwich theorem — без всякого конвоя, просто бутерброд.
-
Даже Коши, заложивший основы этой строгости в 1821 году, не всегда был последователен: в «Курсе анализа» он утверждал, что предел последовательности непрерывных функций всегда непрерывен — утверждение, которое оказалось попросту неверным (контрпример нашёл Абель в 1826 году). Понадобилось ещё несколько десятилетий и понятие равномерной сходимости, чтобы разобраться, при каких условиях предел непрерывных функций действительно непрерывен. Это хороший урок: даже основоположник строгости иногда путал «кажется очевидным» с «доказано».
-
Приоритет в формализации анализа на деле принадлежит не только Коши: чешский математик и философ Бернард Больцано независимо доказал похожие результаты уже в 1817 году, включая аккуратную версию теоремы о промежуточном значении. Но его работа была опубликована в малоизвестном пражском журнале и оставалась практически незамеченной математическим сообществом несколько десятилетий — редкий случай, когда правильная математика существовала, но не была услышана современниками.
-
Условия Роббинса — Монро (1951) для сходимости стохастических итерационных процессов — $\sum_n \eta_n = \infty$ и $\sum_n \eta_n^2 < \infty$ — на первый взгляд выглядят как две произвольные технические оговорки, но по сути это ровно те условия, при которых аргументы вроде теоремы о двух милиционерах и арифметики пределов вообще срабатывают в доказательстве сходимости стохастического градиентного спуска. Вся современная теория сходимости SGD стоит на плечах теорем, разобранных в этом уроке.
Лайфхаки и полезные трюки
-
Перед тем как применить теорему о частном, всегда сначала смотри на предел знаменателя. Если он не ноль — действуй смело, это одна строчка. Если ноль — не подставляй «$A/0$», а сразу ищи способ упростить выражение алгебраически: факторизация для многочленов, умножение на сопряжённое для корней.
-
При $n \to \infty$ (или $x \to \infty$) для рациональных выражений раздели числитель и знаменатель на старшую степень. Это универсальный способ превратить неопределённость $\frac{\infty}{\infty}$ в форму, где числитель и знаменатель имеют конечные пределы, — и только после этого честно применять теорему о частном.
-
Разность корней («$\infty - \infty$») почти всегда лечится домножением на сопряжённое выражение. После этого в числителе исчезают корни, а полученную дробь снова приводишь к виду «раздели на старшую степень» из предыдущего пункта.
-
Если в выражении встречается что-то «дикое» без собственного предела — $\sin n$, $\cos(n^2)$, $(-1)^n$, дробная часть, — не пытайся честно найти его поведение. Ищи для него простую зажимающую пару (обычно константы или простые дроби) и применяй теорему о двух милиционерах, а не арифметику пределов.
-
Расписывай сложный предел как цепочку элементарных операций, называя теорему на каждом шаге. Это не только страхует от ошибок, но и в точности воспроизводит формат доказательств сходимости в статьях по оптимизации — там эта цепочка обычно расписана явно, просто без учебных подписей вроде «по теореме о сумме».
-
Всегда проверяй ответ численно. Подставь большое конкретное $n$ (скажем, $n = 10^6$) в исходное выражение — на калькуляторе или в Python — и сравни с найденным пределом. Если не сходится, ищи ошибку в алгебраическом преобразовании, а не в самой теореме.
Теоремы этого урока — не разрозненный список фактов для запоминания, а рабочий набор инструментов, которым ты будешь пользоваться в каждом следующем уроке анализа: непрерывность, производная, интеграл — всё это определяется через пределы, и всё это нуждается в арифметике пределов, чтобы не доказывать одно и то же через $\varepsilon$-$N$ заново на каждом шаге. Освоил их сейчас — дальше они станут прозрачным фоном, а не отдельным препятствием.
Понял тему? Закрепи в боте! 🚀
Попрактикуйся на задачах и получи персональные рекомендации от AI
💪 Начать тренировку