Теорема Коши 🌉
Представь, что ты сравниваешь две кривые обучения — функцию потерь для одной модели и функцию потерь для другой, обе как функции числа эпох. За весь период обучения первая потеря изменилась на какую-то величину, вторая — на другую. Естественный вопрос: найдётся ли момент времени, в который мгновенное отношение скоростей изменения этих двух потерь совпадает со средним отношением их полных изменений? Ты уже знаешь теорему Лагранжа — она отвечает на похожий вопрос для одной функции: найдётся точка, где мгновенная скорость равна средней. Но там сравнивалось изменение функции с изменением аргумента. А что, если сравнивать изменение одной функции с изменением другой функции, а не аргумента?
Именно на этот вопрос отвечает теорема Коши — иногда её называют обобщённой теоремой о среднем значении, и не случайно: она в буквальном смысле обобщает теорему Лагранжа, включая её как частный случай. Но важность этого урока не только в общности. Теорема Коши — это единственный кирпичик, которого не хватает для строгого доказательства правила Лопиталя: приёма, которым ты наверняка уже пользовался интуитивно для раскрытия неопределённостей $\frac00$ и $\frac{\infty}{\infty}$, даже не подозревая, что за ним стоит серьёзная теорема. В следующем уроке мы это доказательство проведём целиком, а сейчас — соберём для него весь необходимый инструментарий.
Забегая вперёд, в машинном обучении неопределённости вида $\frac00$ возникают куда чаще, чем может показаться: что происходит с сигмоидой на границе численной точности, когда и числитель, и знаменатель некоторого выражения одновременно стремятся к нулю? Как ведёт себя функция потерь вблизи точки, где градиент тоже обнуляется? Правило Лопиталя, а вместе с ним и лежащая под ним теорема Коши, — это математический язык для ответа на подобные вопросы о предельном поведении функций активации и функций потерь именно на границах их области определения.
И ещё один взгляд на эту теорему, отдельный от Лопиталя: если представить, что $f$ и $g$ — это координаты движущейся точки на плоскости, параметризованные общим параметром $t$, теорема Коши становится утверждением о самой обычной геометрии кривой — существовании точки, где касательная параллельна хорде. Так что этот урок — не только подготовка к следующему, но и красивое расширение геометрической интуиции, которую ты уже наработал на теореме Лагранжа.
История: откуда это взялось?
К 1820-м годам математический анализ переживал настоящую революцию строгости. Ты уже встречал главного героя этой революции в прошлых уроках — Огюстен Луи Коши (1789–1857), французский математик и инженер, читавший курс анализа в парижской Политехнической школе. Именно Коши в своём знаменитом учебнике «Cours d'Analyse» (1821) впервые дал строгое определение предела через язык $\varepsilon$ и $\eta$ (позже доработанное Вейерштрассом до привычного тебе $\varepsilon$-$\delta$), избавив производную и интеграл от туманных «бесконечно малых величин», которые почти столетие критиковал философ Джордж Беркли. Теорема о среднем значении, которую мы разбираем сегодня, была опубликована Коши именно в этом контексте — как один из инструментов, необходимых для строгого построения дифференциального и интегрального исчисления с нуля.
Интересно, что мотивация у Коши была вполне конкретной и прикладной: ему требовался строгий способ обосновать вычисление пределов отношений функций, которые одновременно обращаются в ноль. Такой приём — деление числителя и знаменателя дроби $\frac{f(x)}{g(x)}$ на их производные при $x$, стремящемся к точке, где обе функции равны нулю, — был известен математикам ещё с конца XVII века. Его опубликовал в 1696 году Гийом Франсуа Антуан, маркиз де Лопиталь, в первом печатном учебнике по дифференциальному исчислению, хотя, как выяснилось значительно позже из переписки, сам метод фактически открыл швейцарский математик Иоганн Бернулли, который обучал Лопиталя анализу за плату и по контракту передал ему права на свои результаты. Почти сто тридцать лет правило Лопиталя работало как надёжный, проверенный практикой рецепт — но без строгого доказательства, потому что самого понятия строгого предела ещё не существовало.
Коши закрыл этот пробел. Обобщив теорему о среднем значении (которую до него, в куда более узкой форме, для одной функции сформулировал ещё в 1797 году Жозеф Луи Лагранж, а в частном случае экстремума — итальянец Мишель Ролль в 1691 году) на пару функций, Коши получил именно тот инструмент, который позволяет строго обосновать замену $\frac{f(x)}{g(x)}$ на $\frac{f'(x)}{g'(x)}$ при $x$, стремящемся к точке общего нуля. Красивый исторический парадокс: рецепт появился на полтора века раньше своего доказательства, а теорема, которую ты изучаешь в этом уроке, — это тот самый недостающий мост, который наконец сделал старый приём математически безупречным.
Формулировка теоремы Коши
Интуиция: два спидометра вместо одного
Вспомни теорему Лагранжа: если ты проехал путь на машине, то в какой-то момент твоя мгновенная скорость на спидометре совпала со средней скоростью поездки. Теперь представь, что в машине два спидометра, измеряющих не расстояние по обычной дороге, а два разных показателя — скажем, количество пройденных километров $f(t)$ и количество истраченного топлива $g(t)$, оба как функции времени $t$. За всю поездку километраж изменился на $f(b)-f(a)$, расход топлива — на $g(b)-g(a)$. Их отношение — это средний расход топлива на километр за всю поездку. Теорема Коши утверждает: обязательно найдётся момент времени $c$, в который мгновенное отношение показаний двух спидометров, $\frac{f'(c)}{g'(c)}$, в точности совпадёт с этим средним отношением. Не два разных момента для числителя и знаменателя по отдельности — один и тот же момент для обоих сразу.
Формулировка и доказательство
Теорема (Коши). Пусть функции $f$ и $g$ непрерывны на отрезке $[a,b]$, дифференцируемы на интервале $(a,b)$, и $g'(x) \ne 0$ для всех $x \in (a,b)$. Тогда существует точка $c \in (a,b)$ такая, что
$$\frac{f(b)-f(a)}{g(b)-g(a)} = \frac{f'(c)}{g'(c)}$$
Прежде чем доказывать теорему, разберись с деталью, которая часто ускользает от внимания: почему вообще дробь слева определена, то есть почему $g(b) \ne g(a)$? Это не отдельное допущение — это следствие условия $g'(x)\ne0$. Если бы оказалось, что $g(b)=g(a)$, то функция $g$ удовлетворяла бы всем условиям теоремы Ролля (урок 189) на $[a,b]$, а значит нашлась бы точка $x_0\in(a,b)$ с $g'(x_0)=0$ — что прямо противоречит условию теоремы. Значит $g(b)\ne g(a)$ гарантированно, и левая часть формулы корректна.
Теперь доказательство. Введём вспомогательную функцию, комбинирующую $f$ и $g$ так, чтобы применить к ней теорему Ролля:
$$h(x) = f(x) - f(a) - \frac{f(b)-f(a)}{g(b)-g(a)}\bigl(g(x)-g(a)\bigr)$$Функция $h$ непрерывна на $[a,b]$ и дифференцируема на $(a,b)$ как линейная комбинация непрерывных и дифференцируемых $f$ и $g$ (коэффициент перед скобкой — просто число, не зависящее от $x$). Проверим значения на концах:
$$h(a) = f(a)-f(a) - \frac{f(b)-f(a)}{g(b)-g(a)}\cdot 0 = 0$$$$h(b) = f(b)-f(a) - \frac{f(b)-f(a)}{g(b)-g(a)}\bigl(g(b)-g(a)\bigr) = f(b)-f(a) - \bigl(f(b)-f(a)\bigr) = 0$$Итак, $h(a)=h(b)=0$, и $h$ удовлетворяет всем условиям теоремы Ролля на $[a,b]$. Значит существует $c\in(a,b)$, в которой $h'(c)=0$. Вычислим производную $h$:
$$h'(x) = f'(x) - \frac{f(b)-f(a)}{g(b)-g(a)}\cdot g'(x)$$Подставляя $x=c$ и приравнивая к нулю:
$$f'(c) = \frac{f(b)-f(a)}{g(b)-g(a)}\cdot g'(c)$$Осталось разделить обе части на $g'(c)$ — а это законно, потому что по условию теоремы $g'(x)\ne0$ на всём интервале $(a,b)$, в частности и в найденной точке $c$:
$$\frac{f'(c)}{g'(c)} = \frac{f(b)-f(a)}{g(b)-g(a)}$$Теорема доказана. Обрати внимание на структуру рассуждения: это ровно тот же приём, которым (наверняка) доказывалась теорема Лагранжа в предыдущем уроке — построить вспомогательную функцию, обнуляющуюся на концах отрезка, и натравить на неё теорему Ролля. Теорема Коши, теорема Лагранжа и теорема Ролля образуют цепочку, где каждая следующая доказывается через предыдущую, и вся эта цепочка в итоге опирается на теорему Вейерштрасса о достижении экстремума непрерывной функцией на отрезке.
Разбор примеров
Пример 1 (лёгкий). Для $f(x)=x^2$ и $g(x)=x^3$ на отрезке $[1,2]$ найти точку $c$, о существовании которой говорит теорема Коши.
Проверим условия: обе функции непрерывны и дифференцируемы всюду, $g'(x)=3x^2$, и на интервале $(1,2)$ он нигде не обращается в ноль (ноль был бы только при $x=0$). Условия выполнены. Считаем:
$$f(2)-f(1) = 4-1 = 3, \qquad g(2)-g(1) = 8-1 = 7$$$$f'(x) = 2x, \qquad g'(x) = 3x^2, \qquad \frac{f'(c)}{g'(c)} = \frac{2c}{3c^2} = \frac{2}{3c}$$Составляем уравнение теоремы Коши:
$$\frac37 = \frac{2}{3c} \quad\Longrightarrow\quad 9c = 14 \quad\Longrightarrow\quad c = \frac{14}{9} \approx 1{,}556$$Ответ: $c=\dfrac{14}{9}$, и эта точка действительно лежит внутри $(1,2)$.
Пример 2 (средний). Для $f(x)=\sin x$ и $g(x)=\cos x$ на отрезке $\left[0,\frac{\pi}{2}\right]$ найти $c$.
$g'(x)=-\sin x$ обращается в ноль только при $x=0$, а на открытом интервале $\left(0,\frac{\pi}{2}\right)$ синус строго положителен — условие $g'\ne0$ выполнено.
$$f\!\left(\frac\pi2\right)-f(0) = 1-0=1, \qquad g\!\left(\frac\pi2\right)-g(0) = 0-1=-1$$$$\frac{f'(c)}{g'(c)} = \frac{\cos c}{-\sin c} = -\operatorname{ctg} c$$Уравнение теоремы Коши:
$$\frac{1}{-1} = -\operatorname{ctg} c \quad\Longrightarrow\quad \operatorname{ctg} c = 1 \quad\Longrightarrow\quad c = \frac\pi4$$Ответ: $c=\dfrac\pi4$ — ровно середина отрезка по углу, что для пары синус-косинус не случайность, а следствие их симметрии друг относительно друга на этом конкретном отрезке.
Пример 3 (сложный, ML). Две модели обучаются с одинаковой архитектурой, но разной скоростью затухания ошибки: $L_1(t) = e^{-t}$ и $L_2(t) = e^{-2t}$, где $t$ — условная «доля обучения», $t\in[0,1]$. Найти момент $c$, в который мгновенное отношение скоростей затухания потерь совпадает со средним отношением их полных изменений за весь период обучения.
$g'(t) = -2e^{-2t}$ нигде не обращается в ноль — условие выполнено. Вычислим приращения:
$$L_1(1)-L_1(0) = e^{-1}-1, \qquad L_2(1)-L_2(0) = e^{-2}-1$$Заметим, что $e^{-2}-1 = (e^{-1})^2-1 = (e^{-1}-1)(e^{-1}+1)$ — разность квадратов, поэтому дробь красиво упрощается:
$$\frac{L_1(1)-L_1(0)}{L_2(1)-L_2(0)} = \frac{e^{-1}-1}{(e^{-1}-1)(e^{-1}+1)} = \frac{1}{1+e^{-1}}$$Теперь отношение производных:
$$\frac{L_1'(c)}{L_2'(c)} = \frac{-e^{-c}}{-2e^{-2c}} = \frac{e^{c}}{2}$$Составляем уравнение:
$$\frac{1}{1+e^{-1}} = \frac{e^c}{2} \quad\Longrightarrow\quad e^c = \frac{2}{1+e^{-1}} \quad\Longrightarrow\quad c = \ln\frac{2}{1+e^{-1}}$$Численно $1+e^{-1}\approx 1{,}3679$, значит $e^c\approx 1{,}4619$, откуда $c\approx 0{,}380$.
Ответ: $c\approx0{,}380$ — момент обучения (примерно на 38% пути), где мгновенное отношение скоростей затухания двух функций потерь в точности равно отношению их полного изменения за весь период. Такая величина полезна, например, при сравнении скорости сходимости двух конфигураций обучения не «на глаз» по графику, а через строго определённую точку компромисса.
Почему это важно
Ключевое отличие теоремы Коши от «наивной» идеи взять теорему Лагранжа отдельно для $f$ и отдельно для $g$ — в том, что она гарантирует существование одной и той же точки $c$ для обеих функций сразу. Это именно то свойство, ради которого теорема вообще существует: без него было бы невозможно строго обосновать правило Лопиталя, где числитель и знаменатель дроби нужно оценивать одновременно, в одной и той же точке. Ты увидишь это явно уже в конце этого урока, а полностью — в следующем.
Теорема Лагранжа как частный случай
Интуиция: одна из двух функций — просто линейка
Что если вторую функцию $g$ взять максимально простой — просто саму координату $x$? Тогда «изменение $g$» — это буквально длина отрезка, $b-a$, а мгновенная скорость $g'$ равна константе $1$ в каждой точке. Отношение $\frac{f'(c)}{g'(c)}$ вырождается в просто $f'(c)$, а формула теоремы Коши превращается в формулу теоремы Лагранжа, которую ты уже знаешь. Другими словами, теорема Лагранжа — это теорема Коши, в которой одна из двух «кривых обучения» настолько скучная, что просто линейно растёт со временем.
Формальный вывод
Следствие (теорема Лагранжа). Пусть $g(x)=x$. Тогда $g$ непрерывна и дифференцируема всюду, $g'(x)=1\ne0$ для любого $x$ — все условия теоремы Коши автоматически выполнены (при условии, что $f$ непрерывна на $[a,b]$ и дифференцируема на $(a,b)$). Подставляя $g(x)=x$ в формулу теоремы Коши, получаем
$$\frac{f(b)-f(a)}{b-a} = \frac{f'(c)}{1} = f'(c)$$что и есть в точности теорема Лагранжа о среднем значении.
Стоит отдельно остановиться на том, зачем вообще формулировать более общую теорему, если частный случай уже был известен раньше. Дело в том, что во многих задачах — а особенно в доказательстве правила Лопиталя — сравнивать нужно именно скорости изменения двух содержательных функций друг относительно друга, а не относительно «времени» в чистом виде. Формально можно было бы, конечно, ввести время как параметр и рассматривать обе функции параметрически, но именно теорема Коши формулирует этот факт напрямую, без лишнего параметра-посредника.
Разбор примеров
Пример 1 (лёгкий). Для $f(x)=x^2$ на отрезке $[1,3]$ найти $c$ через теорему Лагранжа как частный случай теоремы Коши с $g(x)=x$, и убедиться, что результат совпадает с прямым вычислением по теореме Лагранжа.
$$\frac{f(3)-f(1)}{3-1} = \frac{9-1}{2} = 4$$По формуле $f'(c) = 2c$, значит $2c=4$, откуда $c=2$. Прямая проверка: это именно то, что даёт стандартная формулировка теоремы Лагранжа — $\frac{f(b)-f(a)}{b-a}=f'(c)$ без всякого $g$.
Ответ: $c=2\in(1,3)$. Никакого противоречия: теорема Коши при $g(x)=x$ — это буквально та же самая теорема Лагранжа, просто записанная через более общую формулу.
Пример 2 (средний). Для $f(x)=\ln x$ на $[1,e]$ найти $c$.
$$\frac{f(e)-f(1)}{e-1} = \frac{1-0}{e-1} = \frac{1}{e-1}$$$f'(x)=\dfrac1x$, значит $\dfrac1c = \dfrac{1}{e-1}$, откуда $c=e-1\approx1{,}718$.
Ответ: $c=e-1$, что лежит внутри $(1,e)$, поскольку $e\approx2{,}718$.
Пример 3 (сложный, ML). Функция потерь $L(w)=w^2$ (стандартная квадратичная ошибка) на отрезке весов $[1,4]$ — это диапазон значений веса до и после одного шага оптимизации. Найти вес $c$, где мгновенный градиент потерь равен средней скорости роста потерь на этом шаге.
$$\frac{L(4)-L(1)}{4-1} = \frac{16-1}{3} = 5$$$L'(w)=2w$, значит $2c=5$, откуда $c=2{,}5$.
Ответ: $c=2{,}5\in(1,4)$ — при любом изменении веса от $1$ до $4$ найдётся промежуточное значение веса, в котором мгновенная скорость роста потерь в точности равна средней скорости на всём шаге. Это ровно тот факт, на который опираются некоторые методы контроля шага оптимизатора (line search): они ищут точку с определённым соотношением градиента и среднего изменения, чтобы гарантировать разумный прогресс на шаге.
Почему это важно
Тот факт, что теорема Лагранжа — частный случай теоремы Коши, не просто красивое наблюдение для коллекции математических фактов. Это прямая иллюстрация того, как работает математическое обобщение: вместо того, чтобы доказывать десятки похожих утверждений по отдельности (для одной функции, для двух функций, для параметрических кривых), достаточно доказать одну достаточно общую теорему и затем получать все частные случаи как следствия, меняя одну из функций на что-то простое. Ты ещё не раз встретишь этот приём в курсе, и умение узнавать, что новая теорема — на самом деле старая теорема в маскировке, экономит массу усилий.
Геометрическая интерпретация через параметрические кривые
Интуиция: касательная к траектории движения точки
Ты уже знаешь геометрический смысл теоремы Лагранжа: на графике функции $y=f(x)$ найдётся точка, где касательная параллельна секущей, соединяющей концы графика. Теорема Коши имеет столь же наглядную, но чуть более общую геометрическую картину — только теперь речь идёт не о графике функции одной переменной, а о параметрически заданной кривой.
Представь точку, которая движется по плоскости, и в момент времени $t$ её координаты равны $\bigl(g(t), f(t)\bigr)$ — то есть $x=g(t)$, $y=f(t)$. Такая траектория называется параметрической кривой. Хорда, соединяющая начальную точку траектории $\bigl(g(a),f(a)\bigr)$ и конечную $\bigl(g(b),f(b)\bigr)$, имеет угловой коэффициент $\dfrac{f(b)-f(a)}{g(b)-g(a)}$ — обычная формула наклона прямой через две точки. А угловой коэффициент касательной к самой траектории в момент $t$ — это $\dfrac{dy}{dx} = \dfrac{f'(t)}{g'(t)}$ (это стандартная формула производной параметрически заданной функции: скорость по вертикали делить на скорость по горизонтали). Теорема Коши тогда превращается в чисто геометрическое утверждение.
Формулировка
Геометрическая форма теоремы Коши. Пусть кривая на плоскости задана параметрически, $x=g(t)$, $y=f(t)$, $t\in[a,b]$, причём $f$ и $g$ удовлетворяют условиям теоремы Коши. Тогда на этой кривой найдётся точка (соответствующая параметру $c\in(a,b)$), в которой касательная параллельна хорде, соединяющей начальную и конечную точки кривой.
Обрати внимание: если взять простейшую параметризацию $g(t)=t$ (то есть $x$ совпадает с самим параметром), кривая превращается в обычный график функции $y=f(x)$, а геометрическая форма теоремы Коши дословно совпадает с уже знакомой геометрической формой теоремы Лагранжа. Это тот же самый факт, что и в предыдущем разделе, только увиденный с другой стороны — не алгебраически, а геометрически.
Разбор примеров
Пример 1 (лёгкий). Кривая задана как $x=t$, $y=t^2$ на $[0,2]$ — тривиальная параметризация параболы $y=x^2$. Найти точку, где касательная параллельна хорде.
Хорда идёт от $(0,0)$ до $(2,4)$, её наклон $\dfrac{4-0}{2-0}=2$. Наклон касательной: $\dfrac{f'(t)}{g'(t)} = \dfrac{2t}{1} = 2t$. Уравнение $2c=2$, откуда $c=1$.
Ответ: $c=1$, точка на кривой — $(1,1)$. Это просто ещё одна форма записи примера 1 из предыдущего раздела: геометрически и алгебраически — один и тот же факт.
Пример 2 (средний). Кривая $x=\cos t$, $y=\sin t$ на $\left[0,\dfrac\pi2\right]$ — четверть единичной окружности. Найти точку, где касательная к дуге параллельна хорде, соединяющей её концы.
Хорда идёт от $(1,0)$ до $(0,1)$, наклон $\dfrac{1-0}{0-1}=-1$. Наклон касательной: $\dfrac{f'(t)}{g'(t)} = \dfrac{\cos t}{-\sin t} = -\operatorname{ctg}t$. Уравнение $-\operatorname{ctg}c=-1$, откуда $\operatorname{ctg}c=1$, $c=\dfrac\pi4$.
Ответ: $c=\dfrac\pi4$, точка на окружности — $\left(\dfrac{\sqrt2}{2},\dfrac{\sqrt2}{2}\right)$, ровно середина дуги. Это не случайность: пара функций $f=\sin t$, $g=\cos t$ уже встречалась в примере 2 первого раздела этого урока — там мы искали то же самое число $c$ алгебраически, а здесь получили его геометрически, как точку на окружности, где касательная параллельна хорде, стягивающей четверть дуги.
Пример 3 (сложный, ML). Во время обучения модели отслеживают траекторию в координатах (точность, потеря): $g(t) = 1-e^{-t}$ (точность растёт к $1$) и $f(t) = e^{-t}$ (потеря убывает к $0$), $t$ — номер эпохи, $t\in[0,2]$. Найти точку на этой траектории, где касательная параллельна хорде, соединяющей начало и конец.
Заметим сразу: $f(t)+g(t) = e^{-t}+1-e^{-t}=1$ тождественно — точность и потеря в этой упрощённой модели в сумме всегда дают единицу. Значит $f'(t)=-g'(t)$ в каждой точке, и отношение $\dfrac{f'(t)}{g'(t)}=-1$ постоянно, для любого $t$, а не только в какой-то одной специальной точке.
Проверим, что среднее отношение тоже равно $-1$: $f(2)-f(0) = e^{-2}-1$, $g(2)-g(0) = \bigl(1-e^{-2}\bigr)-0 = 1-e^{-2} = -(e^{-2}-1)$. Отношение $\dfrac{e^{-2}-1}{-(e^{-2}-1)}=-1$ — совпадает.
Ответ: в этом вырожденном случае теорема Коши выполняется буквально в любой точке $c\in(0,2)$, потому что между $f$ и $g$ есть скрытая линейная зависимость ($f+g=\text{const}$). Это полезный концептуальный урок: теорема Коши гарантирует существование хотя бы одной подходящей точки, но иногда таких точек оказывается бесконечно много — и это происходит именно тогда, когда $f$ и $g$ связаны линейным соотношением.
Почему это важно
Геометрическая форма теоремы Коши напрямую применима везде, где данные естественно описываются параметрической кривой: траектория движения (координаты $x(t)$, $y(t)$), эволюция состояния системы в фазовом пространстве, или, как в примере выше, путь модели в пространстве метрик качества во время обучения. В любом из этих случаев теорема гарантирует существование момента, где мгновенное направление движения совпадает со «средним» направлением за весь промежуток наблюдения — а это уже конкретный инструмент анализа, а не абстрактная теорема ради теоремы.
Связь с правилом Лопиталя
Интуиция: зачем вообще всё это нужно
Вот главный практический вопрос, ради которого исторически появилась теорема Коши: как строго вычислить предел вида $\lim\limits_{x\to a}\dfrac{f(x)}{g(x)}$, если и числитель, и знаменатель одновременно стремятся к нулю? Обычная теорема о пределе частного (урок 179) тут бессильна — она требует, чтобы предел знаменателя был отличен от нуля, а здесь оба предела нулевые, и формально получается неопределённость $\frac00$. Идея, интуитивно понятная и много раз проверенная математиками XVIII века, — заменить исходное отношение на отношение производных, $\dfrac{f'(x)}{g'(x)}$, и посчитать предел уже этого, более простого выражения. Но почему эта замена законна? Ответ даёт именно теорема Коши.
Набросок механизма (полное доказательство — в следующем уроке)
Пусть $f(a)=g(a)=0$ (обе функции равны нулю в предельной точке — либо доопределены так по непрерывности), $f$ и $g$ непрерывны и дифференцируемы вблизи $a$, и $g'(x)\ne0$ рядом с $a$ (кроме, может быть, самой точки $a$). Возьмём произвольную точку $x$, близкую к $a$ (для определённости $x>a$), и применим теорему Коши на отрезке $[a,x]$:
$$\frac{f(x)-f(a)}{g(x)-g(a)} = \frac{f'(c_x)}{g'(c_x)} \quad \text{для некоторого } c_x\in(a,x)$$Поскольку $f(a)=g(a)=0$, левая часть упрощается прямо до $\dfrac{f(x)}{g(x)}$:
$$\frac{f(x)}{g(x)} = \frac{f'(c_x)}{g'(c_x)}$$Ключевой шаг: при $x\to a$ точка $c_x$, зажатая между $a$ и $x$, тоже стремится к $a$ — это принцип двух милиционеров, применённый к неравенству $a Пример 1 (лёгкий). Для $f(x)=x^2-1$, $g(x)=x-1$ вблизи точки $x=1$ (где $f(1)=g(1)=0$) явно найти $c_x$ из теоремы Коши на отрезке $[1,x]$ и проверить, что $c_x\to1$ при $x\to1$. Здесь можно проверить всё напрямую, без ограничений: $\dfrac{f(x)}{g(x)} = \dfrac{x^2-1}{x-1} = x+1$ при $x\ne1$. С другой стороны, $f'(t)=2t$, $g'(t)=1$, значит $\dfrac{f'(c)}{g'(c)}=2c$. Уравнение теоремы Коши: $x+1=2c$, откуда Ответ: $c_x$ — это в точности середина отрезка $[1,x]$, и при $x\to1$ имеем $c_x\to1$, как и утверждает общий механизм. Заодно проверяем сам предел: $\lim\limits_{x\to1}\dfrac{f(x)}{g(x)} = \lim\limits_{x\to1}(x+1)=2$, и $\lim\limits_{x\to1}\dfrac{f'(x)}{g'(x)}=\lim\limits_{x\to1}2x=2$ — предел совпадает, как и должно быть по правилу Лопиталя. Пример 2 (средний). Для $f(x)=\sin x$, $g(x)=x$ вблизи $x=0$ (классическая неопределённость $\frac{\sin x}{x}$ при $x\to0$) применить теорему Коши на $[0,x]$ и обсудить связь с первым замечательным пределом. Ответ: при $x\to0$ точка $c$ тоже стремится к нулю, а $\cos c \to \cos 0 = 1$, значит $\dfrac{\sin x}{x}\to1$. Это в точности первый замечательный предел (урок 180), только полученный через совершенно другую конструкцию — не через геометрическое сравнение площадей на единичной окружности, а через теорему Коши. Ценность этого альтернативного пути в том, что он обобщается на функции, для которых никакого удобного геометрического трюка может и не найтись. Пример 3 (сложный, ML). Остаточная ошибка оптимизатора вблизи сходимости моделируется как $f(t)=1-\cos t$, а «идеальная» квадратичная модель сходимости — как $g(t)=t^2$, обе стремятся к нулю при $t\to0$. Применить теорему Коши на $[0,t]$ и связать результат с порядком сходимости оптимизатора. При $t\to0$ имеем $c\to0$, а $\dfrac{\sin c}{2c} = \dfrac12\cdot\dfrac{\sin c}{c} \to \dfrac12\cdot1=\dfrac12$ (снова первый замечательный предел внутри). Ответ: $\lim\limits_{t\to0}\dfrac{1-\cos t}{t^2}=\dfrac12$, а значит вблизи точки сходимости остаточная ошибка ведёт себя как $\dfrac{t^2}{2}$ — это ровно то, что на языке численной оптимизации называют квадратичной сходимостью: ошибка на каждом шаге убывает пропорционально квадрату расстояния до оптимума, а не линейно. Именно такую скорость сходимости обеспечивает, например, метод Ньютона вблизи минимума, и умение строго доказывать подобные асимптотики — это прямое практическое следствие аппарата, который мы здесь построили. Этот раздел — не отдельная тема, а прямая подготовка к следующему уроку. Всё, что нужно для строгого доказательства правила Лопиталя, уже лежит перед тобой: теорема Коши даёт равенство отношений в некоторой промежуточной точке, а принцип двух милиционеров гарантирует, что эта точка «сходится» туда же, куда стремится исходная переменная. В следующем уроке эта идея будет доведена до полной строгости, с учётом всех предельных случаев — но интеллектуальная работа, которая делает правило Лопиталя не «магическим трюком», а доказанной теоремой, уже проделана здесь. Задание 1: Для $f(x)=x^2$, $g(x)=x$ на $[2,5]$ найти точку $c$ из теоремы Коши. Задание 2: Для $f(x)=x^3$, $g(x)=x^2$ на $[1,2]$ найти $c$. Задание 3: Для $f(x)=e^x$, $g(x)=x$ на $[0,1]$ найти $c$. Задание 4: Для $f(x)=\cos x$, $g(x)=\sin x$ на $\left[0,\dfrac\pi4\right]$ найти $c$. Задание 5: Для $f(x)=\ln x$, $g(x)=x^2$ на $[1,2]$ найти $c$. Задание 6: Для $f(x)=x$, $g(x)=x^2$ на $[1,3]$ найти $c$. Задание 7: Для $f(x)=\sin x$, $g(x)=x$ на $[0,\pi]$ найти $c$. Задание 8: Для $f(x)=x^3$, $g(x)=x$ на $[0,3]$ найти $c$. Задание 9: Для $f(x)=\sqrt x$, $g(x)=x$ на $[1,4]$ найти $c$. Задание 10 (ML): Функция потерь $L(w)=(w-2)^2$, $g(w)=w$ на отрезке весов $[0,3]$. Найти вес $c$, где мгновенный градиент потерь равен средней скорости изменения потерь на этом отрезке. Задание 11: Для $f(x)=e^{2x}$, $g(x)=e^{x}$ на $[0,\ln2]$ найти $c$. Задание 12: Кривая задана как $x=2\cos t$, $y=3\sin t$ (четверть эллипса) на $\left[0,\dfrac\pi2\right]$. Найти точку, где касательная параллельна хорде между концами дуги. Задание 13: Для $f(x)=\ln(x+1)$, $g(x)=x$ на $[0,e-1]$ найти $c$. Задание 14 (ML): Для $f(w)=w^3$, $g(w)=w^2$ на $[1,3]$ (моделируем нелинейное соотношение двух метрик обучения) найти $c$. Задание 15: Докажи, что если $f(x)=g(x)+C$ (константа) на $[a,b]$, то теорема Коши выполняется для любой точки $c\in(a,b)$. Задание 16: Для $f(x)=x^4$, $g(x)=x^2$ на $[1,2]$ найти $c$. Задание 17 (физика): Траектория снаряда без сопротивления воздуха: $x(t)=10t$, $y(t)=10t-5t^2$, $t\in[0,1]$. Найти момент $c$, где касательная к траектории параллельна прямой, соединяющей точку старта и точку в момент $t=1$. Задание 18 (ML): Кривые обучения для двух скоростей обучения: $L_1(t)=\dfrac{1}{1+t}$, $L_2(t)=\dfrac{1}{1+2t}$ на $[0,1]$. Найти $c$. Задание 19: Для $f(x)=\operatorname{arctg}x$, $g(x)=x$ на $[0,1]$ найти $c$. Задание 20 (концептуальное): Для пары $f(x)=x^2$, $g(x)=x^3$ на $[1,2]$ найди отдельно точку $c_1$ из теоремы Лагранжа для $f$, точку $c_2$ из теоремы Лагранжа для $g$, и сравни обе с точкой $c=\dfrac{14}{9}$ из теоремы Коши для пары $(f,g)$ (задание 2 этого урока). Объясни, почему $c_1$, $c_2$ и $c$ — три разных числа, хотя формально $\dfrac{f'(c_1)}{g'(c_2)}$ тоже «сходится» с нужным отношением. Задание 21: Доказать теорему Коши, построив вспомогательную функцию $h(x) = f(x)-f(a) - \dfrac{f(b)-f(a)}{g(b)-g(a)}\bigl(g(x)-g(a)\bigr)$ и применив к ней теорему Ролля. Задание 22: Покажи на примере, что если условие $g'(x)\ne0$ на $(a,b)$ нарушено, теорема Коши может стать неприменимой из-за деления на ноль в самой формулировке. Используй $g(x)=x^2-x$, $f(x)=x$ на $[0,1]$. Задание 23: Выведи теорему Лагранжа как частный случай теоремы Коши для произвольной функции $f$, дифференцируемой на $(a,b)$ и непрерывной на $[a,b]$, полагая $g(x)=x$. Задание 24: Для пары $f(x)=e^{\alpha x}$, $g(x)=e^{\beta x}$ ($\alpha\ne\beta$, оба ненулевые) на произвольном $[a,b]$ выведи общее уравнение для точки $c$ и укажи, всегда ли оно разрешимо явно. Задание 25: Используя теорему Коши на $[0,x]$ для $f(x)=1-\cos x$, $g(x)=x^2$, найди точку $c_x$ явно (приближённо) при $x=0{,}1$ и убедись, что $c_x\in(0,0{,}1)$. Задание 26 (ML, доказательное): Функция потерь $L(w)$ дважды дифференцируема, достигает нуля в точке минимума $w^*$ (то есть $L(w^*)=0$) и имеет там $L'(w^*)=0$, $L''(w^*)>0$. Используя теорему Коши дважды, покажи, что $\dfrac{L(w)-L(w^*)}{(w-w^*)^2}\to\dfrac{L''(w^*)}{2}$ при $w\to w^*$. Задание 27: Для $f(x)=x^5$, $g(x)=x^3$ на $[1,2]$ найти $c$. Задание 28 (доказательное): Покажи, что если $f'(x)=k\cdot g'(x)$ для некоторой константы $k$ и всех $x\in(a,b)$, то теорема Коши для пары $(f,g)$ выполняется в любой точке $c\in(a,b)$ — обобщи наблюдение из примера 3 раздела о геометрической интерпретации. Задание 29: Для пары $f(x)=x^2$, $g(x)=x^3$ при фиксированном $a=1$ и переменном $b$ найди явную формулу $c(b)$ и вычисли $\lim\limits_{b\to1}c(b)$, подтверждая общий факт, что при стягивании отрезка $[a,b]$ в точку соответствующая точка $c$ тоже стремится к этой точке. Задание 30 (концептуальное): Функция $g(x)=x^3$ строго монотонна на $[-1,1]$, но $g'(0)=0$. Возьми $f(x)=x$ и покажи, что теорема Ролля для вспомогательной функции $h(x)=x-x^3$ на $[-1,1]$ всё же не «ломает» теорему Коши в этом случае, но объясни в общих словах, почему условие $g'(x)\ne0$ на всём интервале требуется именно потому, что заранее неизвестно, в какой точке теорема Ролля отыщет ноль $h'$. Ошибка 1. Считают, что точки $c_1$ (из теоремы Лагранжа для $f$) и $c_2$ (из теоремы Лагранжа для $g$) — это одно и то же, что и точка $c$ теоремы Коши. Как выглядит: находят $c_1$ и $c_2$ по отдельности и подставляют их как будто они совпадают, получая $\dfrac{f'(c_1)}{g'(c_1)}$ вместо честного применения теоремы Коши. Почему возникает: кажется естественным, что раз обе теоремы дают «похожие» точки где-то в середине отрезка, они должны совпадать. Как правильно: задание 20 этого урока явно показывает, что $c_1$, $c_2$ и $c$ — как правило, три разных числа. Теорема Коши гарантирует существование именно одной общей точки для обеих функций сразу — в этом её содержательная сила, и подменять её двумя независимыми точками Лагранжа нельзя. Ошибка 2. Забывают проверить условие $g'(x)\ne0$ на всём интервале, а не только в предполагаемой точке $c$. Как выглядит: сразу составляют уравнение теоремы Коши и решают его, не убедившись, что $g'$ нигде не обращается в ноль на $(a,b)$. Почему возникает: условие кажется технической формальностью, которую легко пропустить, особенно когда $g$ выглядит «безобидно». Как правильно: задание 22 показывает, к чему приводит нарушение этого условия — $g(a)$ может совпасть с $g(b)$, и дробь в формулировке теоремы попросту не определена. Проверка $g'\ne0$ на всём интервале — не формальность, а гарантия, что сама постановка задачи имеет смысл. Ошибка 3. Путают теорему Коши с теоремой Лагранжа и не замечают, когда одна автоматически сводится к другой. Как выглядит: для пары $(f, g)$ с $g(x)=x$ применяют полную громоздкую формулу теоремы Коши, не замечая, что она тривиально упрощается до теоремы Лагранжа. Почему возникает: недостаточное узнавание частного случая внутри общей формулы. Как правильно: если $g(x)=x$, сразу используй упрощённую форму $\dfrac{f(b)-f(a)}{b-a}=f'(c)$ — теорема Коши в этом случае не даёт ничего нового сверх теоремы Лагранжа, и полная формула лишь усложняет вычисления. Ошибка 4. Неверно составляют пропорцию, перепутывая местами $f$ и $g$ или числитель со знаменателем. Как выглядит: пишут $\dfrac{g(b)-g(a)}{f(b)-f(a)} = \dfrac{f'(c)}{g'(c)}$ вместо правильного $\dfrac{f(b)-f(a)}{g(b)-g(a)} = \dfrac{f'(c)}{g'(c)}$ — числитель и знаменатель должны согласованно относиться к одной и той же функции по обе стороны равенства. Почему возникает: формула симметрична по внешнему виду, и легко перепутать, какая функция играет роль «числителя», а какая — «знаменателя». Как правильно: держи в голове мнемонику: приращения функций стоят в том же порядке, что и их производные — $f$ сверху и слева, $g$ снизу и справа, и это правило одинаково с обеих сторон равенства. Ошибка 5. Применяют теорему Коши к разрывной или недифференцируемой функции, не проверив условия на границе интервала. Как выглядит: берут функцию с изломом (типа $|x|$) или с разрывом внутри $[a,b]$ и всё равно ищут точку $c$, не замечая, что условия теоремы не выполнены. Почему возникает: внимание сосредоточено на алгебре уравнения теоремы Коши, а не на проверке предпосылок, хотя они не менее важны, чем сама формула. Как правильно: прежде чем составлять уравнение, всегда явно проверяй: непрерывность $f$ и $g$ на замкнутом $[a,b]$, дифференцируемость обеих на открытом $(a,b)$, и $g'(x)\ne0$ на этом же открытом интервале — без этой тройной проверки численный ответ, даже если он «получился», не гарантированно корректен. Ошибка 6. Считают, что теорема Коши гарантирует единственность точки $c$. Как выглядит: найдя одно решение уравнения теоремы Коши, автоматически считают его единственно возможным. Почему возникает: теорема формулируется как «существует точка $c$», и по умолчанию воспринимается как «существует ровно одна». Как правильно: теорема гарантирует существование хотя бы одной такой точки, но их может быть и больше одной — задание 15 и задание 28 этого урока прямо показывают случаи, где подходит любая точка интервала. Уравнение теоремы Коши, составленное для конкретных $f$ и $g$, может иметь несколько корней в интервале $(a,b)$, и все они формально корректны. Формулировка: если $f,g$ непрерывны на $[a,b]$, дифференцируемы на $(a,b)$ и $g'(x)\ne0$ на $(a,b)$, то существует $c\in(a,b)$: $\dfrac{f(b)-f(a)}{g(b)-g(a)} = \dfrac{f'(c)}{g'(c)}$. Условие $g'(x)\ne0$ автоматически гарантирует $g(b)\ne g(a)$ (иначе теорема Ролля дала бы противоречащий нулевой корень $g'$) — левая часть формулы всегда определена. Доказательство строится через вспомогательную функцию $h(x)=f(x)-f(a)-\dfrac{f(b)-f(a)}{g(b)-g(a)}\bigl(g(x)-g(a)\bigr)$, обнуляющуюся на концах отрезка, и применение к ней теоремы Ролля. Теорема Лагранжа — частный случай теоремы Коши при $g(x)=x$: подстановка $g'(x)=1$ сразу даёт классическую формулу $\dfrac{f(b)-f(a)}{b-a}=f'(c)$. Геометрический смысл: для параметрической кривой $x=g(t)$, $y=f(t)$ теорема Коши утверждает существование точки, где касательная к кривой параллельна хорде, соединяющей её концы. Точка $c$ теоремы Коши для пары функций в общем случае не совпадает с точками из отдельных теорем Лагранжа для $f$ и $g$ по отдельности — важность теоремы именно в существовании общей точки. Если $f$ и $g$ связаны линейной зависимостью ($f'=k\,g'$ тождественно), теорема Коши выполняется в любой точке интервала, а не только в одной специальной. Связь с правилом Лопиталя: применяя теорему Коши на $[a,x]$ при $f(a)=g(a)=0$, получаем $\dfrac{f(x)}{g(x)} = \dfrac{f'(c_x)}{g'(c_x)}$, где $c_x\to a$ при $x\to a$ — это ядро доказательства правила Лопиталя, которое будет строго завершено в следующем уроке. Теорема Коши позволяет доказывать асимптотическое поведение функций вблизи особых точек — в частности, квадратичную скорость сходимости оптимизационных методов вблизи минимума функции потерь. Уравнение теоремы Коши для конкретных $f,g$ не всегда решается явно в элементарных функциях — теорема гарантирует существование точки $c$, но не всегда даёт удобный способ её точного вычисления. Весь этот урок опирается на теорему Ролля (урок 189) — она используется как ядро доказательства, спрятанное внутри вспомогательной функции $h$. Не менее важна теорема Лагранжа (урок 190): теорема Коши её напрямую обобщает, и понимание, как строится её доказательство через ту же самую вспомогательную конструкцию, делает доказательство теоремы Коши почти автоматическим повторением уже знакомого приёма. Также необходимо уверенное владение строгим определением производной (урок 186) и понятием непрерывности (уроки 183, 185) — без них условия теоремы («непрерывна на $[a,b]$, дифференцируема на $(a,b)$») останутся пустыми словами. Следующий урок, 192 «Правило Лопиталя», — это прямое и незамедлительное продолжение сегодняшнего материала: набросок из последнего раздела этого урока будет доведён до полностью строгого доказательства, с разбором всех особых случаев — неопределённости $\frac{\infty}{\infty}$, пределов на бесконечности, ситуаций, когда сам предел отношения производных не существует. Дальше в курсе теорема Коши всплывёт ещё раз при выводе формулы Тейлора с остаточным членом в форме Лагранжа — это ещё одно её масштабное применение, которое встретится позже. 🤖 ML/AI. Строгое обоснование правила Лопиталя для анализа предельного поведения функций активации и функций потерь на границах области определения; анализ квадратичной скорости сходимости оптимизаторов второго порядка вблизи минимума (задание 26); сравнение относительной скорости изменения двух метрик обучения через общую точку компромисса (примеры этого урока про кривые обучения). 📐 Геометрия и физика. Анализ параметрически заданных траекторий — точка, где мгновенное направление движения совпадает со средним направлением за весь путь (полёт снаряда, движение по кривой). 📊 Численные методы. Оценка погрешности приближённых формул и анализ сходимости итерационных процессов часто опираются именно на обобщённую теорему о среднем значении, а не на её частный (лагранжев) случай, когда сравниваются сразу две связанные величины. 🧮 Дальнейший матанализ. Прямой строительный блок для формулы Тейлора с остаточным членом и для строгого обоснования множества предельных переходов, где простая теорема о пределе частного не работает. Правило Лопиталя было опубликовано в 1696 году — почти на сто тридцать лет раньше теоремы Коши, которая его наконец строго обосновала. Всё это время математики пользовались приёмом «поделить производные», полагаясь на интуицию и практический успех метода, а не на строгое доказательство. Метод, названный именем маркиза де Лопиталя, в действительности открыл швейцарский математик Иоганн Бернулли: по контракту он обучал Лопиталя анализу за регулярную плату и передавал ему права на свои математические результаты — редкий в истории науки случай прямой «покупки» открытия. Теорема Ролля, лежащая в фундаменте и теоремы Лагранжа, и теоремы Коши, была сформулирована самим Мишелем Роллем в 1691 году в узком алгебраическом контексте — для многочленов — и первоначально не воспринималась как утверждение общего анализа; более того, Ролль в молодости был известен как жёсткий критик только зарождавшегося дифференциального исчисления, считая его недостаточно строгим — забавная ирония, учитывая, что его имя теперь носит одна из опорных теорем этой самой дисциплины. Огюстен Коши — не только автор строгого определения предела и теоремы, разобранной в этом уроке, но и один из самых плодовитых математиков в истории: он опубликовал около восьмисот научных работ, а его имя носят десятки теорем и объектов в самых разных областях анализа, от комплексного анализа (интегральная формула Коши) до теории дифференциальных уравнений (задача Коши). Перед тем как решать уравнение теоремы Коши, всегда проверяй, не упрощается ли задача до теоремы Лагранжа. Если одна из функций линейна (или вообще совпадает с $x$), нет смысла тащить за собой полную формулу — переходи сразу к упрощённому виду. Если приращение $g(b)-g(a)$ или $f(b)-f(a)$ раскладывается на множители (разность квадратов, разность кубов), всегда пробуй это сделать до составления уравнения — как в примере 3 первого раздела, где $e^{-2}-1=(e^{-1}-1)(e^{-1}+1)$ мгновенно упрощает дробь и избавляет от лишней алгебры при поиске $c$. Для параметрических кривых сразу переводи задачу на язык наклонов: наклон хорды — это просто $\dfrac{\Delta y}{\Delta x}$ между конечными точками, наклон касательной — $\dfrac{f'(t)}{g'(t)}$; вся геометрическая интуиция теоремы Лагранжа (касательная параллельна секущей) переносится один в один, только «секущая» превращается в «хорду», а «график» — в «параметрическую кривую». Проверяй условие $g'(x)\ne0$ в первую очередь, а не в последнюю — если оно нарушено, дальнейшие вычисления могут оказаться бессмысленными (задание 22), и лучше обнаружить это до, а не после долгих алгебраических преобразований. Держи в голове, что теорема Коши — не самостоятельная «вещь в себе», а инструмент, конечная цель которого чаще всего — доказать что-то другое: правило Лопиталя, асимптотику функции вблизи особой точки, формулу Тейлора. Когда встречаешь задачу с двумя функциями, одновременно стремящимися к общему значению (обычно к нулю), в первую очередь подумай, не решается ли она именно через теорему Коши. Если после составления уравнения теоремы Коши отношение $\dfrac{f'(c)}{g'(c)}$ оказывается константой, не зависящей от $c$ (как в задании про точность и потерю или в задании 28), не паникуй — это означает, что $f$ и $g$ связаны линейной зависимостью, и подходит любая точка интервала; такой случай не противоречит теореме, а лишь предельно её упрощает. Теорема Коши на первый взгляд выглядит как техническое обобщение уже знакомой теоремы Лагранжа — ещё одна формула для коллекции. Но её настоящая роль раскроется уже на следующем уроке, когда правило Лопиталя, которым ты, скорее всего, пользовался интуитивно ещё до серьёзного знакомства с математическим анализом, наконец получит строгое обоснование — и этим обоснованием будет ровно то доказательство, которое ты только что разобрал вручную. Держи в голове главный образ этого урока: две функции, зажатые между общей точкой начала и общей точкой конца, и точка $c$ где-то между ними, в которой их мгновенные скорости соотносятся друг с другом ровно так же, как соотносятся их полные изменения. Этот образ — тот самый мост, который через один шаг приведёт тебя к одному из самых практичных приёмов во всём математическом анализе. Попрактикуйся на задачах и получи персональные рекомендации от AIРазбор примеров
Почему это важно
Практика: 30 заданий
Базовые задания (1–10)
Средние задания (11–20)
Продвинутые задания (21–30)
Частые ошибки
Главное запомнить
Связь с другими темами курса
Что нужно было знать до этого урока
Что изучить дальше
Где это нужно в жизни
Интересные факты
Лайфхаки и полезные трюки
Понял тему? Закрепи в боте! 🚀