🔴 Сложный ⏱️ 55 минут

Точки экстремума

📋 Содержание урока

Точки экстремума 🏔️

В уроке 139 ты научился находить критические точки — места, где $f'(x) = 0$ или где производной нет. И там же прозвучало предупреждение, которое стоит повторить: это список подозреваемых, а не список виновных. Критическая точка — адрес, по которому надо зайти и проверить. Кто-то из них окажется вершиной горы, кто-то — дном ямы, а кто-то просто мгновением, когда график на секунду выположился и поехал дальше в ту же сторону, никого не обманув, кроме невнимательного решателя.

Этот урок целиком про то, как отличить одних от других. Инструмент будет ровно один и предельно наглядный: смена знака производной. Шёл вверх, стал идти вниз — значит, между этими двумя состояниями была вершина. Шёл вниз, пошёл вверх — было дно. Знак не поменялся — никакой вершины не было, как бы убедительно ни выглядела горизонтальная касательная.

Тема выглядит школьной, а стоит за ней вся оптимизация. Обучение любой нейросети — это поиск минимума функции потерь. Оптимизатор двигается туда, куда указывает антиградиент, и останавливается там, где градиент обнулился. Вопрос «а точно ли ноль градиента означает минимум?» — не философский: от ответа зависит, обучилась модель или застряла. И ответ, который ты получишь в этом уроке на одномерном случае, слово в слово переносится на пространство из миллиарда параметров: нулевая производная сама по себе не гарантирует ничего.

Ещё в этом уроке мы разберёмся с двумя вещами, на которых теряют баллы на любом экзамене: разницей между «точкой экстремума» и «экстремумом» (это разные объекты, и путать их дорого) и разницей между локальным экстремумом и наибольшим значением функции (это разные задачи, и вторая — тема урока 142).

🎯 Ты узнаешь:

  • Строгое определение локального максимума и минимума через окрестность — и почему слово «локальный» здесь главное
  • В чём разница между точкой экстремума (это $x$) и экстремумом (это $f(x)$), и как эту разницу оформлять в ответе
  • Теорему Ферма — необходимое условие экстремума — вместе с идеей доказательства и тремя оговорками, без которых она превращается в ложное утверждение
  • Достаточное условие через смену знака $f'$: правило «$+$ на $-$ — максимум, $-$ на $+$ — минимум», строгую формулировку и место, где непрерывность обязательна
  • Как искать экстремумы там, где производной вообще нет: $|x|$, $1 - \sqrt[3]{x^2}$ и почему у $\sqrt[3]{x}$ экстремума нет
  • Полный алгоритм исследования с таблицей знаков и три полностью оформленных эталонных решения
  • Почему в глубоком обучении $\nabla L = 0$ чаще всего означает седловую точку или плато, а не минимум, и что с этим делают на практике

История: откуда это взялось?

Первым, кто научился искать максимум системно, а не угадыванием, был Пьер де Ферма. Около 1629 года (опубликовано много позже, в трактате «Methodus ad disquirendam maximam et minimam» — «Метод отыскания наибольших и наименьших значений») он придумал приём, который назвал адекватированием. Идея была почти гениальной в своей наглости: возьмём точку максимума $x$ и близкую к ней точку $x + e$. Около вершины функция меняется очень медленно, поэтому значения $f(x)$ и $f(x+e)$ почти равны — Ферма писал между ними не знак равенства, а специальный значок «приблизительного равенства». Дальше он раскрывал скобки, сокращал на $e$ — и только потом объявлял $e$ равным нулю. Ровно то, что мы сегодня делаем аккуратно через предел, только без всякого понятия предела: до Коши оставалось двести лет.

Занятно, что интуиция «около вершины изменение почти нулевое» появилась даже раньше Ферма — у Иоганна Кеплера. В 1615 году он издал «Nova stereometria doliorum vinariorum» («Новая стереометрия винных бочек»), написанную после того, как его не устроило, как австрийский торговец меряет объём бочки одной палкой через отверстие. Разбираясь с формой бочки, Кеплер заметил: у самой выгодной пропорции объём почти не реагирует на небольшое изменение размеров, поэтому австрийские бочкари могут работать грубо и всё равно попадать близко к оптимуму. Это ровно наблюдение «в точке экстремума производная равна нулю», сформулированное за четырнадцать лет до Ферма и без единой формулы.

Метод Ферма вызвал знаменитый скандал: Декарт, получив рукопись через Мерсенна в 1638 году, объявил метод неверным и пытался поймать автора на ошибке. Ферма ответил разбором задач, которые декартовым способом не решались, и спор закончился признанием. Лагранж полтора века спустя написал, что именно Ферма следует считать первым изобретателем дифференциального исчисления. Строгую формулировку — ту самую, которую мы сейчас называем теоремой Ферма, с внутренней точкой и дифференцируемостью, — оформили уже в XIX веке, когда Больцано, Коши и Вейерштрасс навели порядок в основаниях анализа. А признак экстремума по смене знака производной стал стандартным разделом учебников после Эйлера, который в «Institutiones calculi differentialis» (1755) впервые аккуратно перечислил, какие бывают случаи в критической точке.


Что такое экстремум: точка, значение и окрестность

Интуиция: горный хребет, а не карта мира

Представь, что ты идёшь по горному хребту с востока на запад. Ты стоишь на вершине холма, если и слева, и справа от тебя земля ниже. При этом совершенно неважно, что в тридцати километрах отсюда торчит пик втрое выше: ты всё равно стоишь на вершине этого холма. Экстремум — это про сравнение с ближайшими соседями, а не про рекорд по всей стране.

Именно поэтому слово в определении — локальный. Локальный максимум может быть смехотворно низким по сравнению с другими участками графика. Функция $f(x) = x^3 - 3x$ имеет локальный максимум в точке $x = -1$ со значением $f(-1) = 2$, а в точке $x = 3$ она принимает значение $f(3) = 18$ — в девять раз больше. И это не противоречие: $x = -1$ — вершина своего холма, а $x = 3$ просто лежит на далёком склоне, который уходит вверх и никакой вершиной не является.

Формализуется соседство через окрестность: окрестность точки $x_0$ — это любой интервал $(x_0 - \delta;\, x_0 + \delta)$ с $\delta > 0$. «Соседи» — это точки из такого интервала.

Определение: Точка $x_0$ называется точкой локального максимума функции $f$, если существует такая окрестность $(x_0-\delta;\,x_0+\delta)$, входящая в область определения $f$, что для всех $x$ из этой окрестности выполняется $f(x) \leqslant f(x_0)$.

Точка $x_0$ называется точкой локального минимума, если существует такая окрестность, что для всех $x$ из неё $f(x) \geqslant f(x_0)$.

Если неравенства строгие при $x \neq x_0$, экстремум называют строгим. Точки максимума и минимума общим словом называют точками экстремума, а значения функции в них — экстремумами функции.

Разберём определение по частям, там четыре важные детали.

Деталь первая: «существует такая окрестность». Не «для всех», а «существует». Достаточно найти хотя бы один — пусть крошечный — интервал вокруг точки, где неравенство держится. Радиус $\delta$ может быть равен $0{,}001$, и это ничего не портит.

Деталь вторая: точка экстремума и экстремум — разные объекты. Точка экстремума — это значение аргумента, число на оси $x$. Экстремум (максимум или минимум функции) — это значение функции, число на оси $y$. Для $f(x) = (x-3)^2 + 1$ точка минимума равна $3$, а минимум функции равен $1$. Написать «минимум функции равен $3$» — распространённая и обидная потеря балла: проверяющий видит, что человек не различает $x$ и $y$. Универсальное лекарство — в ответе всегда писать обе величины явно: «точка минимума $x_{\min} = 3$, минимум $f_{\min} = f(3) = 1$».

Деталь третья: окрестность должна лежать в области определения. Поэтому точками экстремума считают только внутренние точки области определения. Концы отрезка внутренними не являются: у точки $x = 2$ для функции, заданной на $[-1;\,2]$, нет полной двусторонней окрестности внутри области. Про концы — отдельный разговор в уроке 142.

Деталь четвёртая: нестрогий экстремум — тоже экстремум. Если функция на целом промежутке равна константе, каждая точка этого промежутка формально является и точкой максимума, и точкой минимума: неравенства $f(x) \leqslant f(x_0)$ и $f(x) \geqslant f(x_0)$ выполняются как равенства. В школьных задачах обычно ищут строгие экстремумы, но помнить про этот случай стоит — в ML он встречается на каждом шагу под именем «плато».

Примеры с разбором

Пример 1 (простой). $f(x) = (x-3)^2 + 1$. Показать по определению, что $x_0 = 3$ — точка строгого локального минимума, и назвать минимум.

Шаг 1. Возьмём любое $x \neq 3$. Тогда $(x-3)^2 > 0$, значит $f(x) = (x-3)^2 + 1 > 1$.

Шаг 2. А $f(3) = 0 + 1 = 1$. Получается $f(x) > f(3)$ для всех $x \neq 3$ — причём для всех, а не только для близких.

Шаг 3. Определение требует существования хотя бы одной окрестности с таким свойством. Годится любая, например $(2;\,4)$.

Ответ: $x_{\min} = 3$ — точка строгого локального минимума; минимум функции $f_{\min} = 1$.

Пример 2 (средний). $f(x) = x^3 - 3x$. Сравнить значение в точке локального максимума $x = -1$ со значением $f(3)$ и объяснить, почему это не противоречие.

Шаг 1. Посчитаем: $f(-1) = -1 + 3 = 2$ и $f(3) = 27 - 9 = 18$.

Шаг 2. Проверим, что $x = -1$ действительно точка локального максимума. Возьмём окрестность $(-2;\,0)$ и посчитаем несколько значений: $f(-1{,}5) = -3{,}375 + 4{,}5 = 1{,}125$, $f(-1) = 2$, $f(-0{,}5) = -0{,}125 + 1{,}5 = 1{,}375$. Соседи ниже ✅

Шаг 3. Теперь про «противоречие». Определение локального максимума требует, чтобы $f(x) \leqslant f(-1)$ только для $x$ из некоторой окрестности точки $-1$. Точка $x = 3$ ни в какую окрестность точки $-1$ радиусом меньше $4$ не попадает, и никаких обязательств перед ней у нашего максимума нет.

Ответ: $f(-1) = 2$ — локальный максимум, $f(3) = 18 > 2$, противоречия нет: локальность означает сравнение только с ближайшими соседями.

Пример 3 (сложный). Функция задана так: $f(x) = 2$ при $x \in [1;\,4]$ и $f(x) = 2 - (x-1)^2(x-4)^2$ вне этого отрезка. Какие точки являются точками экстремума?

Шаг 1. Вне отрезка $[1;\,4]$ множитель $(x-1)^2(x-4)^2$ строго положителен, значит $f(x) < 2$ там всюду. Внутри отрезка $f(x) = 2$ ровно.

Шаг 2. Возьмём внутреннюю точку отрезка, например $x_0 = 2$. Окрестность $(1{,}5;\,2{,}5)$ целиком лежит в отрезке, и на ней $f(x) = 2 = f(2)$. Значит, одновременно $f(x) \leqslant f(2)$ и $f(x) \geqslant f(2)$ — точка $x_0=2$ является и точкой нестрогого максимума, и точкой нестрогого минимума.

Шаг 3. Теперь конец плато, $x_0 = 4$. Слева от него функция равна $2$, справа строго меньше $2$. Значит, $f(x) \leqslant f(4)$ во всей окрестности — это точка нестрогого локального максимума. Строгим он не является: слева есть точки с тем же значением.

Шаг 4. Точки вне отрезка точками экстремума не будут: там функция строго монотонна на каждом луче (это видно из того, что она строго меньше $2$ и приближается к $2$ при подходе к отрезку).

Ответ: каждая точка отрезка $[1;\,4]$ — точка нестрогого локального максимума; каждая внутренняя точка $(1;\,4)$ — вдобавок точка нестрогого локального минимума. Максимум функции равен $2$.

Почему это важно

Все три примера бьют в одну мысль: экстремум — понятие сравнительное и местное. Оно не про рекорд и не про «самую высокую точку графика». Из этого сразу следуют два практических вывода.

Первый: у функции может быть сколько угодно локальных максимумов, и все они разной высоты. Поиск «настоящего» лучшего значения — отдельная задача, и решается она сравнением, а не дифференцированием (урок 142).

Второй: алгоритм оптимизации, который умеет только «идти вниз, пока идётся вниз», по построению останавливается в локальном минимуме и о существовании других ям не подозревает. Градиентный спуск — ровно такой алгоритм. Вся культура работы с ним — случайные рестарты, моментум, шум в SGD, разогрев learning rate — это способы не остаться навсегда в первой попавшейся ямке. Определение через окрестность, которое сейчас выглядит формальностью, — точная причина, по которой эти приёмы вообще нужны.


Необходимое условие: теорема Ферма

Интуиция: на вершине склона нет

Ты стоишь на вершине гладкого холма. Куда наклонена земля под ногами? Никуда: если бы был уклон вперёд, ты мог бы сделать шаг и оказаться выше — значит, ты стоял не на вершине. Если бы был уклон назад, то же самое, только шаг в другую сторону. Единственный вариант, при котором ни один короткий шаг не поднимает выше, — горизонтальная площадка. Наклон касательной равен нулю, то есть $f'(x_0) = 0$.

Слово «гладкий» здесь работает. На остроконечной вершине — как у графика $y = -|x|$ — уклон есть и слева, и справа, просто в разные стороны, и никакой единой касательной нет. Про такие вершины теорема Ферма ничего не говорит, и это её честное ограничение, а не дырка.

Теорема (Ферма, необходимое условие экстремума): Пусть функция $f$ определена в некоторой окрестности точки $x_0$, имеет в точке $x_0$ локальный экстремум и дифференцируема в этой точке. Тогда

$$f'(x_0) = 0.$$

Идея доказательства. Пусть для определённости $x_0$ — точка локального максимума, то есть в некоторой окрестности $f(x_0 + h) \leqslant f(x_0)$, значит приращение $\Delta f = f(x_0+h) - f(x_0) \leqslant 0$ при всех достаточно малых $h$. Посмотрим на разностное отношение $\dfrac{\Delta f}{h}$ с двух сторон.

Справа, при $h > 0$: числитель $\leqslant 0$, знаменатель $> 0$, значит дробь $\leqslant 0$. Переходя к пределу при $h \to 0^{+}$, получаем $f'(x_0) \leqslant 0$ (нестрогое неравенство при предельном переходе сохраняется).

Слева, при $h < 0$: числитель по-прежнему $\leqslant 0$, а знаменатель теперь $< 0$, значит дробь $\geqslant 0$. Предел при $h \to 0^{-}$ даёт $f'(x_0) \geqslant 0$.

Функция дифференцируема в $x_0$, поэтому оба односторонних предела существуют и равны одному и тому же числу $f'(x_0)$. Число, которое одновременно $\leqslant 0$ и $\geqslant 0$, может быть только нулём. Значит, $f'(x_0) = 0$. Для минимума рассуждение то же самое с перевёрнутыми знаками. ∎

Красота этого доказательства в том, что вся его работа — в противоречии между двумя сторонами. Односторонние отношения тянут производную в разные стороны, а дифференцируемость заставляет их совпасть — и остаётся только ноль.

Три оговорки, без которых теорема ломается

Оговорка 1: только внутренние точки. Функция $f(x) = x$ на отрезке $[0;\,1]$ принимает наибольшее значение в точке $x = 1$, при этом $f'(1) = 1 \neq 0$. Противоречия нет: точка $1$ — конец отрезка, у неё нет двусторонней окрестности внутри области определения, и определение локального максимума к ней в нашем соглашении неприменимо. В теореме прямо написано: $f$ определена в окрестности $x_0$. Это ограничение аукнется в уроке 142: именно поэтому при поиске наибольшего значения на отрезке концы приходится проверять отдельно, руками.

Оговорка 2: только там, где производная существует. У $f(x) = |x|$ в точке $x = 0$ очевиднейший минимум, но производной там нет: слева наклон $-1$, справа $+1$. Теорема Ферма про эту точку молчит — не «противоречит», а именно молчит, поскольку её условие (дифференцируемость) не выполнено. Практическое следствие: искать кандидатов только уравнением $f'(x)=0$ нельзя, часть экстремумов при этом теряется.

Оговорка 3, главная: условие необходимое, но не достаточное. Теорема утверждает импликацию в одну сторону: экстремум ⟹ производная ноль. Обратная импликация неверна. Эталонный контрпример — $f(x) = x^3$ в нуле: $f'(x) = 3x^2$, $f'(0) = 0$, а экстремума нет, потому что функция строго возрастает на всей прямой ($f(-0{,}1) = -0{,}001 < f(0) = 0 < f(0{,}1) = 0{,}001$). Логика здесь ровно как в бытовом примере: «если человек чемпион мира по бегу, он умеет бегать» — верно; «если человек умеет бегать, он чемпион мира» — нет.

Из оговорок 2 и 3 вместе получается вывод, который уже прозвучал в уроке 139 и теперь получил обоснование: критические точки — это кандидаты. Ни один из них не становится ответом без проверки.

Примеры с разбором

Пример 1 (простой). Проверить теорему Ферма на функции $f(x) = 4x - x^2$.

Шаг 1. Найдём производную: $f'(x) = 4 - 2x$.

Шаг 2. График — парабола ветвями вниз с вершиной в $x = 2$, значит в этой точке максимум. По теореме Ферма производная там обязана быть нулём.

Шаг 3. Проверяем: $f'(2) = 4 - 4 = 0$ ✅ Теорема выполняется.

Ответ: $x = 2$ — точка максимума, $f'(2) = 0$, необходимое условие выполнено; максимум $f(2) = 4$.

Пример 2 (средний). Показать, что для $f(x) = x^3 + 3x^2 + 3x + 1$ условие $f'(x_0)=0$ выполняется, а экстремума нет.

Шаг 1. Заметим, что $f(x) = (x+1)^3$ — это куб суммы. Производная: $f'(x) = 3(x+1)^2$.

Шаг 2. Уравнение $3(x+1)^2 = 0$ даёт единственный корень $x_0 = -1$. Необходимое условие в нём выполнено.

Шаг 3. Знак производной: квадрат $(x+1)^2$ неотрицателен всегда, значит $f'(x) > 0$ при любом $x \neq -1$. Слева от $-1$ производная положительна, справа тоже положительна.

Шаг 4. Функция возрастает и слева, и справа от точки $-1$, то есть проходит её «не притормаживая» в смысле направления. Проверим числами: $f(-1{,}1) = (-0{,}1)^3 = -0{,}001$, $f(-1) = 0$, $f(-0{,}9) = 0{,}001$ — значения строго растут ✅

Ответ: $x_0 = -1$ — стационарная точка, экстремума в ней нет. Условие $f'(x_0)=0$ необходимое, но не достаточное.

Пример 3 (сложный). Функция $f(x) = |x| + x^2$. Есть ли у неё экстремум? Что говорит про эту точку теорема Ферма?

Шаг 1. Область определения — вся прямая. При $x \geqslant 0$ имеем $f(x) = x^2 + x$, при $x < 0$ имеем $f(x) = x^2 - x$.

Шаг 2. Производная справа от нуля: $f'(x) = 2x + 1$, при $x \to 0^{+}$ она стремится к $1$. Слева: $f'(x) = 2x - 1$, при $x \to 0^{-}$ стремится к $-1$. Односторонние производные равны $1$ и $-1$, они различны — производной в нуле не существует.

Шаг 3. Экстремум при этом есть, и очень явный: $f(0) = 0$, а при любом $x \neq 0$ имеем $|x| > 0$ и $x^2 > 0$, значит $f(x) > 0 = f(0)$. Это строгий локальный (и даже глобальный) минимум.

Шаг 4. Что говорит теорема Ферма? Ничего. Её условие — дифференцируемость в точке — не выполнено, поэтому теорема к точке $x=0$ просто не применяется. Из неё нельзя вывести ни $f'(0)=0$, ни отсутствие экстремума.

Ответ: $x_{\min} = 0$, минимум $f_{\min} = 0$; производная в этой точке не существует, теорема Ферма неприменима.

Почему это важно

Теорема Ферма — это фильтр. Она не находит экстремумы, она сокращает область поиска: вместо бесконечного множества точек прямой остаётся конечный (обычно) список корней уравнения $f'(x)=0$ плюс точки без производной. Без этого фильтра оптимизация была бы перебором, с ним — решением уравнения.

Ровно этим фильтром пользуется всё численное машинное обучение. Условие «градиент равен нулю» в многомерном случае записывается как $\nabla L(w) = 0$ — это система из миллионов уравнений, и любой оптимизатор по сути ищет её решение. Но заметь симметрию с одномерным случаем: система $\nabla L(w) = 0$ — это тоже только необходимое условие. Строчка в логе «gradient norm ≈ 1e-7» доказывает, что мы пришли в критическую точку, и ровно ничего не доказывает про то, минимум это или нет. Понимание этой асимметрии отделяет человека, который читает логи обучения, от человека, который на них надеется.


Достаточное условие: смена знака производной

Интуиция: подъём, вершина, спуск

Вернёмся на хребет. Если ты шёл в гору, а потом пошёл под гору, то между этими двумя участками ты обязательно прошёл вершину — иначе как бы подъём превратился в спуск. На языке производной: слева $f' > 0$ (растёт), справа $f' < 0$ (убывает), между ними — максимум.

И обратная картина: шёл вниз, потом пошёл вверх — прошёл дно ямы. Слева $f' < 0$, справа $f' > 0$ — минимум.

А если и слева, и справа знак один и тот же, то функция как росла, так и растёт (или как убывала, так и убывает). Ни вершины, ни дна не было, что бы там ни творилось с производной ровно в точке.

Теорема (первое достаточное условие экстремума): Пусть функция $f$ непрерывна в точке $x_0$ и дифференцируема в некоторой проколотой окрестности этой точки, то есть на $(x_0-\delta;\,x_0)\cup(x_0;\,x_0+\delta)$. Тогда:

  1. если $f'(x) > 0$ на $(x_0-\delta;\,x_0)$ и $f'(x) < 0$ на $(x_0;\,x_0+\delta)$ — то $x_0$ является точкой строгого локального максимума;
  2. если $f'(x) < 0$ на $(x_0-\delta;\,x_0)$ и $f'(x) > 0$ на $(x_0;\,x_0+\delta)$ — то $x_0$ является точкой строгого локального минимума;
  3. если знак $f'$ на обоих промежутках одинаков — то экстремума в $x_0$ нет.

Мнемоника, которую стоит запомнить намертво:

  • Знак $f'$ меняется с $+$ на $-$ (при движении слева направо) → максимум. График рисует «горку» ∩.
  • Знак $f'$ меняется с $-$ на $+$ → минимум. График рисует «яму» ∪.
  • Знак не меняется → экстремума нет, только выполаживание или излом без смены направления.

Как это выводится из уже известного: на левом промежутке $f' > 0$, значит по теореме о монотонности (урок 140) функция там возрастает, и по непрерывности $f(x) \leqslant f(x_0)$ для $x$ слева. На правом промежутке $f' < 0$, функция убывает, значит $f(x) \leqslant f(x_0)$ и справа. Оба неравенства вместе — это ровно определение локального максимума.

Где прячется непрерывность

Требование «$f$ непрерывна в точке $x_0$» выглядит формальностью — и не является ею. Разберём контрпример, который стоит увидеть один раз и запомнить навсегда.

Пусть

$$f(x) = \begin{cases} x^2, & x \neq 0,\\ 1, & x = 0.\end{cases}$$

Производная при $x \neq 0$ равна $2x$: слева от нуля она отрицательна, справа положительна. Смена знака $-$ на $+$ — по правилу должен быть минимум. А что на самом деле? $f(0) = 1$, тогда как в любой окрестности нуля есть точки со значениями порядка $0{,}0001$ — то есть гораздо меньше единицы. Минимума нет и близко: точка $x=0$ здесь, наоборот, точка строгого локального максимума (в окрестности $(-0{,}5;\,0{,}5)$ все значения $x^2 < 0{,}25 < 1$).

Разрыв «поднял» точку над её же окрестностью и вывернул вывод наизнанку. Поэтому в формулировке непрерывность в самой точке $x_0$ стоит отдельным условием, хотя дифференцируемость в ней не требуется — этот баланс и позволяет теореме работать с изломами.

Примеры с разбором

Пример 1 (простой, многочлен). Найти точки экстремума и экстремумы функции $f(x) = x^3 - 3x^2 - 9x + 5$.

Шаг 1. Область определения: $D(f) = \mathbb{R}$.

Шаг 2. $f'(x) = 3x^2 - 6x - 9 = 3(x^2 - 2x - 3) = 3(x-3)(x+1)$.

Шаг 3. Критические точки: $x = -1$ и $x = 3$. Точек без производной нет — многочлен дифференцируем всюду.

Шаг 4. Таблица знаков. Пробные точки: $x=-2$, $x=0$, $x=4$.

$x$ $(-\infty;-1)$ $-1$ $(-1;3)$ $3$ $(3;+\infty)$
знак $f'$ $+$ $0$ $-$ $0$ $+$
$f$ max min

Проверка пробными точками: $f'(-2) = 3\cdot(-5)\cdot(-1) = 15 > 0$; $f'(0) = 3\cdot(-3)\cdot 1 = -9 < 0$; $f'(4) = 3\cdot 1\cdot 5 = 15 > 0$ ✅

Шаг 5. Значения: $f(-1) = -1 - 3 + 9 + 5 = 10$; $f(3) = 27 - 27 - 27 + 5 = -22$.

Ответ: $x_{\max} = -1$, максимум $f_{\max} = 10$; $x_{\min} = 3$, минимум $f_{\min} = -22$.

Пример 2 (средний, дробь). Найти точки экстремума функции $f(x) = x + \dfrac{4}{x}$.

Шаг 1. Область определения: $x \neq 0$, то есть $D(f) = (-\infty;0)\cup(0;+\infty)$. Точка $x=0$ не является критической — функция в ней не определена, но числовую прямую она разбивает, и в таблицу её внести обязательно.

Шаг 2. $f'(x) = 1 - \dfrac{4}{x^2} = \dfrac{x^2-4}{x^2} = \dfrac{(x-2)(x+2)}{x^2}$.

Шаг 3. Критические точки: $x = -2$ и $x = 2$ (обе входят в область определения ✅).

Шаг 4. Знак $f'$ определяется числителем, так как $x^2 > 0$ всегда:

$x$ $(-\infty;-2)$ $-2$ $(-2;0)$ $0$ $(0;2)$ $2$ $(2;+\infty)$
знак $f'$ $+$ $0$ $-$ не опр. $-$ $0$ $+$
$f$ max разрыв min

Шаг 5. Значения: $f(-2) = -2 - 2 = -4$; $f(2) = 2 + 2 = 4$.

Шаг 6. Обрати внимание на курьёз: максимум функции здесь равен $-4$, а минимум равен $4$, то есть максимум меньше минимума. Ошибки нет — это опять локальность: они находятся на разных ветвях гиперболы, разделённых разрывом, и друг с другом не сравниваются.

Ответ: $x_{\max} = -2$, максимум $-4$; $x_{\min} = 2$, минимум $4$.

Пример 3 (сложный, экспонента). Найти точки экстремума функции $f(x) = x^2 e^{-x}$.

Шаг 1. Область определения: $\mathbb{R}$, экспонента определена всюду.

Шаг 2. Производная по правилу произведения и цепному правилу (уроки 136-138):

$$f'(x) = 2x\,e^{-x} + x^2\cdot(-e^{-x}) = e^{-x}\left(2x - x^2\right) = e^{-x}\cdot x(2-x).$$

Шаг 3. Множитель $e^{-x}$ строго положителен при любом $x$ — значит, на знак он не влияет вообще, и знак $f'$ совпадает со знаком $x(2-x)$. Это ключевой приём для всех функций с экспонентой: экспонента из анализа знаков вылетает сразу.

Шаг 4. Критические точки: $x = 0$ и $x = 2$.

$x$ $(-\infty;0)$ $0$ $(0;2)$ $2$ $(2;+\infty)$
знак $x$ $-$ $0$ $+$ $+$ $+$
знак $(2-x)$ $+$ $+$ $+$ $0$ $-$
знак $f'$ $-$ $0$ $+$ $0$ $-$
$f$ min max

Шаг 5. Значения: $f(0) = 0$; $f(2) = 4e^{-2} = \dfrac{4}{e^2} \approx 0{,}541$.

Ответ: $x_{\min} = 0$, минимум $0$; $x_{\max} = 2$, максимум $\dfrac{4}{e^2} \approx 0{,}541$.

Почему это важно

Достаточное условие — это то место, где ты перестаёшь угадывать и начинаешь доказывать. Критические точки давали список подозреваемых; смена знака выносит по каждому приговор, и других инструментов для этого в твоём распоряжении пока нет.

Существует и второй достаточный признак экстремума — он появится в уроке 143 вместе со второй производной; в отличие от него, признак по смене знака работает всегда, в том числе в точках, где производной нет, и потому остаётся основным инструментом темы.

Практическая ценность разбора знаков особенно видна на функциях с экспонентой и логарифмом. Множители вида $e^{-x}$, $e^{x}$, $\frac{1}{x^2}$ на знак не влияют, и после их отбрасывания от страшной производной остаётся многочлен, знаки которого читаются в две секунды. Половина работы в задачах этой темы — не найти производную, а грамотно её разложить на множители.


Когда производной нет, а экстремум есть

Три канонические картинки

Теорема Ферма ищет ноль производной. Но производная — вещь капризная, и она вполне может не существовать в точке, где сама функция чувствует себя прекрасно. Экстремум там при этом никуда не девается. Разберём три эталонных случая: их формы полезно узнавать мгновенно.

Случай 1: излом. $y = |x|$.

Функция определена всюду, $f(0) = 0$, и при любом $x \neq 0$ имеем $f(x) = |x| > 0$. Значит, $x=0$ — строгий локальный минимум. Производная: при $x<0$ она равна $-1$, при $x>0$ равна $+1$, в нуле её нет (односторонние наклоны различны). График в нуле образует излом — острый угол между двумя лучами. Смена знака производной с $-$ на $+$ налицо, непрерывность в нуле есть, достаточное условие работает и даёт минимум ✅

Случай 2: острие с вертикальной касательной. $y = 1 - \sqrt[3]{x^2}$.

Область определения — вся прямая: кубический корень берётся от неотрицательного $x^2$ и определён всегда. Перепишем как $y = 1 - x^{2/3}$ и продифференцируем:

$$y' = -\frac{2}{3}x^{-1/3} = -\frac{2}{3\sqrt[3]{x}}.$$

Уравнение $y' = 0$ решений не имеет вовсе — дробь с ненулевым числителем нулю не равна. Зато при $x=0$ знаменатель обращается в ноль, и производной там нет. Знаки: при $x<0$ кубический корень отрицателен, значит $y' = -\frac{2}{3\cdot(\text{отр.})} > 0$; при $x>0$ имеем $y' < 0$. Смена $+$ на $-$ — максимум, $y_{\max} = y(0) = 1$.

Что с графиком? При $x \to 0$ модуль производной уходит в бесконечность: касательная становится вертикальной. График подходит к точке $(0;\,1)$ двумя почти отвесными ветвями и образует острие (точку возврата), направленное вверх. Это не гладкая шапочка, как у параболы, а именно шип.

Случай 3: производной нет, а экстремума нет тоже. $y = \sqrt[3]{x}$.

Область определения — вся прямая, $y' = \frac{1}{3}x^{-2/3} = \dfrac{1}{3\sqrt[3]{x^2}}$. В нуле производной нет (знаменатель ноль), значит $x=0$ — критическая точка. Но знаменатель $\sqrt[3]{x^2}$ положителен при любом $x \neq 0$, поэтому $y' > 0$ и слева, и справа. Знак не меняется — экстремума нет. Функция строго возрастает на всей прямой, просто в нуле у неё вертикальная касательная и график проходит её «вертикально», не разворачиваясь.

Сопоставь случаи 2 и 3: в обоих производной в нуле нет, в обоих касательная вертикальна, а исходы противоположны. Ещё раз: сам факт отсутствия производной ничего не решает, решает только смена знака.

Правило поиска кандидатов: точками экстремума могут быть только те точки $x_0$ из области определения $f$, в которых либо $f'(x_0) = 0$, либо $f'(x_0)$ не существует. Полный список кандидатов = (корни уравнения $f'(x)=0$) ∪ (точки области определения, где $f'$ не существует).

Примеры с разбором

Пример 1 (простой). $f(x) = |x - 5| - 3$. Найти точки экстремума.

Шаг 1. $D(f) = \mathbb{R}$. Раскроем модуль: при $x \geqslant 5$ имеем $f(x) = x - 8$, при $x < 5$ имеем $f(x) = 2 - x$.

Шаг 2. Производная: $f'(x) = -1$ при $x<5$ и $f'(x)=+1$ при $x>5$. В точке $x=5$ односторонние наклоны разные — производной нет. Уравнение $f'(x)=0$ решений не имеет: производная равна $\pm 1$ и нулём не бывает.

Шаг 3. Единственный кандидат — $x=5$. Функция в нём непрерывна ($\lim$ слева $= \lim$ справа $= f(5) = -3$). Знак меняется с $-$ на $+$ → минимум.

Ответ: $x_{\min} = 5$, минимум $f_{\min} = -3$. Производная в точке минимума не существует.

Пример 2 (средний). $f(x) = \sqrt[3]{(x-1)^2} = (x-1)^{2/3}$. Исследовать на экстремум.

Шаг 1. $D(f) = \mathbb{R}$.

Шаг 2. По цепному правилу: $f'(x) = \dfrac{2}{3}(x-1)^{-1/3} = \dfrac{2}{3\sqrt[3]{x-1}}$.

Шаг 3. Нулей нет; при $x=1$ производной нет, а функция определена ($f(1)=0$). Кандидат один: $x=1$.

Шаг 4. Знаки: при $x<1$ имеем $\sqrt[3]{x-1} < 0$, значит $f' < 0$; при $x>1$ имеем $f' > 0$. Смена $-$ на $+$ → минимум.

Шаг 5. Проверим числами: $f(0{,}9) = \sqrt[3]{0{,}01} \approx 0{,}215$, $f(1) = 0$, $f(1{,}1) \approx 0{,}215$ ✅ Соседи выше.

Ответ: $x_{\min} = 1$, минимум $0$; касательная в этой точке вертикальна, график образует острие вниз.

Пример 3 (сложный). $f(x) = |x^2 - 9|$. Найти все точки экстремума.

Шаг 1. $D(f) = \mathbb{R}$. Раскроем модуль по знаку подмодульного выражения: при $|x| \geqslant 3$ имеем $f(x) = x^2 - 9$, при $|x| < 3$ имеем $f(x) = 9 - x^2$.

Шаг 2. Производная по кускам: при $x < -3$ и при $x > 3$ имеем $f'(x) = 2x$; при $-3 < x < 3$ имеем $f'(x) = -2x$. В точках $x = \pm 3$ односторонние производные различаются: например, в $x=3$ слева $-2\cdot 3 = -6$, справа $2\cdot 3 = 6$. Производной там нет.

Шаг 3. Кандидаты: $x = -3$, $x = 3$ (нет производной) и $x = 0$ (там $f'(x) = -2x = 0$).

Шаг 4. Таблица знаков:

$x$ $(-\infty;-3)$ $-3$ $(-3;0)$ $0$ $(0;3)$ $3$ $(3;+\infty)$
$f'$ $2x<0$ нет $-2x>0$ $0$ $-2x<0$ нет $2x>0$
знак $-$ $+$ $-$ $+$
$f$ min max min

Шаг 5. Значения: $f(-3) = 0$, $f(0) = 9$, $f(3) = 0$.

Ответ: точки минимума $x = -3$ и $x = 3$, минимумы равны $0$ (производной в них нет); точка максимума $x = 0$, максимум $9$.

Почему это важно

Функции с модулем и корнями чётной степени — не экзотика. Модуль в математике данных — это метрика $L_1$: MAE-лосс $\frac1n\sum|y_i - \hat y_i|$, регуляризация Lasso $\lambda\sum|w_j|$. Обе не дифференцируемы ровно там, где живёт минимум, и оптимизаторы имеют дело именно с этим.

И тут одномерная картинка объясняет главное свойство L1-регуляризации: у $|w|$ в нуле излом, а не гладкая ямка. Функция потерь с добавкой $\lambda|w|$ имеет ярко выраженный уголок в точке $w = 0$, и минимум суммы очень часто попадает точно в этот уголок — поэтому Lasso занулят веса точно, а не «почти», и получается разреженная модель. У гладкой L2-добавки $\lambda w^2$ никакого уголка нет, минимум уезжает в точку около нуля, но не в ноль. Разница между двумя самыми популярными регуляризаторами — это буквально разница между $|x|$ и $x^2$ в нуле, между изломом и гладким дном.

Практическое следствие для фреймворков: torch.abs и nn.ReLU в нуле возвращают не производную (её нет), а соглашение — обычно $0$ или $1$. Это субградиент, и он работает, но знать, что там принято решение по договорённости, а не вычислена математика, полезно при отладке.


Полный алгоритм и эталонные решения

Все куски собираются в одну процедуру. Она рабочая: до конца курса ты будешь выполнять её десятки раз, поэтому лучше сразу заучить порядок шагов и оформление.

Алгоритм исследования функции на экстремум:

  1. Найти область определения $D(f)$.
  2. Вычислить $f'(x)$ и разложить её на множители — это половина успеха.
  3. Найти все критические точки: корни $f'(x)=0$ и точки из $D(f)$, где $f'$ не существует.
  4. Отметить на прямой критические точки и границы/разрывы области определения, разбив $D(f)$ на промежутки.
  5. Определить знак $f'$ на каждом промежутке (пробной точкой или по множителям) и записать в таблицу.
  6. По каждой критической точке вынести вердикт: $+\!\to\!-$ — максимум, $-\!\to\!+$ — минимум, знак не сменился — экстремума нет.
  7. Вычислить значения функции в точках экстремума и записать ответ, назвав и точки, и значения.

Ловушки, на которых теряют результат чаще всего:

  • Пропустили шаг 1 и внесли в ответ точку, в которой функция не определена.
  • На шаге 4 забыли отметить разрыв, «протянули» вывод о знаке через дырку и получили несуществующий экстремум.
  • На шаге 3 искали только корни $f'(x)=0$ и потеряли излом.
  • На шаге 7 назвали точку, но не назвали значение (или наоборот).

Эталон 1: многочлен

Задача. Исследовать на экстремум функцию $f(x) = 2x^3 - 3x^2 - 12x + 5$.

Шаг 1. Область определения. Многочлен определён всюду: $D(f) = \mathbb{R}$.

Шаг 2. Производная.

$$f'(x) = 6x^2 - 6x - 12 = 6(x^2 - x - 2) = 6(x-2)(x+1).$$

Шаг 3. Критические точки. $f'(x) = 0 \iff x = -1$ или $x = 2$. Точек без производной нет.

Шаг 4-5. Таблица знаков. Пробные точки $-2$, $0$, $3$:

  • $f'(-2) = 6\cdot(-4)\cdot(-1) = 24 > 0$
  • $f'(0) = 6\cdot(-2)\cdot 1 = -12 < 0$
  • $f'(3) = 6\cdot 1\cdot 4 = 24 > 0$
$x$ $(-\infty;-1)$ $-1$ $(-1;2)$ $2$ $(2;+\infty)$
$f'(x)$ $+$ $0$ $-$ $0$ $+$
$f(x)$ max min

Шаг 6. Вердикты. В точке $x=-1$ знак меняется с $+$ на $-$ → максимум. В точке $x=2$ знак меняется с $-$ на $+$ → минимум.

Шаг 7. Значения.

  • $f(-1) = 2\cdot(-1) - 3\cdot 1 + 12 + 5 = -2 - 3 + 12 + 5 = 12$
  • $f(2) = 2\cdot 8 - 3\cdot 4 - 24 + 5 = 16 - 12 - 24 + 5 = -15$

Ответ: $x_{\max} = -1$, максимум $f_{\max} = 12$; $x_{\min} = 2$, минимум $f_{\min} = -15$.

Эталон 2: дробь с разрывом

Задача. Исследовать на экстремум функцию $f(x) = \dfrac{x^2}{x-1}$.

Шаг 1. Область определения. $x - 1 \neq 0$, значит $D(f) = (-\infty;1)\cup(1;+\infty)$.

Шаг 2. Производная по правилу частного:

$$f'(x) = \frac{2x(x-1) - x^2\cdot 1}{(x-1)^2} = \frac{2x^2 - 2x - x^2}{(x-1)^2} = \frac{x^2 - 2x}{(x-1)^2} = \frac{x(x-2)}{(x-1)^2}.$$

Шаг 3. Критические точки. Числитель ноль при $x=0$ и $x=2$ — обе точки в $D(f)$ ✅. При $x=1$ производной нет, но и функции нет — это не критическая точка, а разрыв.

Шаг 4-5. Таблица. Знаменатель $(x-1)^2 > 0$ всюду, кроме $x=1$, значит знак $f'$ равен знаку $x(x-2)$:

$x$ $(-\infty;0)$ $0$ $(0;1)$ $1$ $(1;2)$ $2$ $(2;+\infty)$
$f'(x)$ $+$ $0$ $-$ не опр. $-$ $0$ $+$
$f(x)$ max разрыв min

Шаг 6. Вердикты. $x=0$: смена $+ \to -$ → максимум. $x=2$: смена $- \to +$ → минимум. Точка $x=1$ на роль экстремума не претендует — функции там нет.

Шаг 7. Значения.

  • $f(0) = \dfrac{0}{-1} = 0$
  • $f(2) = \dfrac{4}{1} = 4$

Ответ: $x_{\max} = 0$, максимум $0$; $x_{\min} = 2$, минимум $4$. Максимум снова меньше минимума — ветви разделены разрывом в $x=1$.

Эталон 3: логарифм

Задача. Исследовать на экстремум функцию $f(x) = \dfrac{\ln x}{x}$.

Шаг 1. Область определения. Логарифм требует $x > 0$, знаменатель требует $x \neq 0$. Итого $D(f) = (0;+\infty)$.

Шаг 2. Производная по правилу частного:

$$f'(x) = \frac{\frac1x\cdot x - \ln x\cdot 1}{x^2} = \frac{1 - \ln x}{x^2}.$$

Шаг 3. Критические точки. $1 - \ln x = 0 \iff \ln x = 1 \iff x = e$. Точек без производной внутри $D(f)$ нет.

Шаг 4-5. Таблица. Знаменатель $x^2 > 0$, значит знак $f'$ равен знаку $(1 - \ln x)$. Логарифм возрастает, поэтому $\ln x < 1$ при $x < e$ и $\ln x > 1$ при $x > e$:

$x$ $(0;e)$ $e$ $(e;+\infty)$
$f'(x)$ $+$ $0$ $-$
$f(x)$ max

Шаг 6. Вердикт. Смена $+$ на $-$ → максимум.

Шаг 7. Значение. $f(e) = \dfrac{\ln e}{e} = \dfrac{1}{e} \approx 0{,}368$.

Ответ: $x_{\max} = e \approx 2{,}718$, максимум $f_{\max} = \dfrac1e \approx 0{,}368$; минимумов нет.

Эта функция, кстати, известная: из неё следует, что $\sqrt[3]{3} > \sqrt[\pi]{\pi} > \sqrt[e]{e}$... точнее, что $e^{1/e}$ — наибольшее среди всех $x^{1/x}$. Из максимума в точке $e$ получается и знаменитое сравнение $e^{\pi} > \pi^{e}$.

Почему это важно

Алгоритм ценен не тем, что «так положено оформлять», а тем, что он не даёт потерять случаи. Каждый его пункт закрывает конкретную ловушку, на которую в этой теме наступают тысячи людей: пункт 1 — точки вне области, пункт 3 — изломы, пункт 4 — разрывы, пункт 6 — «нашёл ноль производной, объявил экстремум», пункт 7 — «точка вместо значения».

Тот же порядок действий переносится в код почти дословно. Когда пишут численный поиск экстремумов функции, честная реализация делает ровно это: определяет допустимую область, считает производную (аналитически или численно), находит нули с помощью бисекции или метода Ньютона, а потом проверяет знаки слева и справа от каждого найденного корня. Реализация, которая пропускает последний шаг, время от времени возвращает точку перегиба вместо минимума — и это не гипотетический баг, а классическая ошибка в самописных оптимизаторах.


Локальный экстремум и наибольшее значение: не путать

Есть две задачи, которые звучат похоже и решаются по-разному. Разграничим их сейчас, а технику второй возьмём в уроке 142.

Задача A (эта тема). Найти точки локального экстремума: где функция лучше своих соседей. Инструмент — смена знака $f'$. Ответ может состоять из нескольких точек, а может быть пустым.

Задача B (урок 142). Найти наибольшее и наименьшее значение функции на заданном множестве — обычно на отрезке $[a;\,b]$: где функция лучше всех точек этого множества. Ответ — всегда конкретное число (если функция непрерывна на отрезке).

Три факта, которые разводят эти задачи окончательно:

  • Наибольшее значение может достигаться там, где нет экстремума. У $f(x)=x$ на $[0;\,3]$ наибольшее значение $3$ достигается в точке $x=3$ — на конце отрезка. Точек экстремума у этой функции нет вообще: производная равна $1$ и знак не меняет.
  • Локальный максимум может быть меньше значения в другой точке. У $f(x) = x^3 - 3x$ локальный максимум равен $2$, а на отрезке $[-2;\,3]$ наибольшее значение равно $f(3) = 18$. Локальный максимум — не рекорд.
  • Локальных экстремумов может не быть, а наибольшее значение — быть. Пример из первого пункта. Верно и наоборот: у $f(x)=x^2$ на всей прямой минимум есть, а наибольшего значения нет (функция неограниченно растёт).

Полезная бытовая аналогия: локальный максимум — «самый высокий дом на своей улице», наибольшее значение — «самое высокое здание в городе». Первое проверяется взглядом налево-направо, второе — только сравнением по списку всех кандидатов. В уроке 142 этот список будет выглядеть так: критические точки внутри отрезка плюс оба конца, и дальше — простое сравнение значений.

Почему это важно

В прикладных задачах почти всегда нужна задача B: «максимальная прибыль», «минимальный расход», «лучшее качество модели». Но решается она через задачу A — сначала находим кандидатов внутри, потом добираем концы. Человек, который считает эти задачи одной и той же, регулярно теряет ответ на границе.

В обучении моделей граница — это не абстракция. Ограничения вида «вероятность лежит в $[0;1]$», «вес не отрицателен» (NMF), «норма вектора не больше единицы» (clipping) делают допустимое множество ограниченным, и оптимум сплошь и рядом садится ровно на границу, где градиент не равен нулю и никакого экстремума в смысле этого урока нет. Для таких задач существует отдельная теория (условия Каруша — Куна — Таккера), но интуиция начинается здесь: граница — отдельный кандидат, её проверяют руками.


Нулевой градиент в машинном обучении: минимум, седло или плато

Необходимое условие в многомерном виде

У функции многих переменных $L(w_1, \dots, w_n)$ роль производной играет градиент — вектор частных производных $\nabla L = \left(\frac{\partial L}{\partial w_1}, \dots, \frac{\partial L}{\partial w_n}\right)$. Теорема Ферма обобщается почти дословно:

Если во внутренней точке $w^{*}$ дифференцируемая функция $L$ имеет локальный экстремум, то $\nabla L(w^{*}) = 0$.

Доказательство буквально то же самое, только применённое $n$ раз: зафиксируй все координаты, кроме $i$-й, получи функцию одной переменной, у которой в $w^{*}_i$ экстремум, — и по одномерной теореме Ферма её производная (то есть $\partial L/\partial w_i$) равна нулю. И так для каждой координаты.

Точки с нулевым градиентом называют стационарными. И вот тут одномерный урок начинает окупаться: как $f'(x_0)=0$ не означало экстремум, так и $\nabla L = 0$ не означает минимум. Только в многомерном случае всё гораздо хуже.

Седловые точки: почему их доля растёт с размерностью

Возьмём простейшую двумерную функцию $L(w_1, w_2) = w_1^2 - w_2^2$. Градиент $(2w_1,\, -2w_2)$ обращается в ноль в единственной точке — начале координат. Что там?

  • Если двигаться вдоль оси $w_1$ (зафиксировав $w_2 = 0$), получается $L = w_1^2$ — парабола ветвями вверх, у нуля минимум.
  • Если двигаться вдоль оси $w_2$, получается $L = -w_2^2$ — парабола ветвями вниз, у нуля максимум.

По одному направлению дно, по другому вершина. Такая точка называется седловой (по форме конской седловки или горного перевала: поперёк седла вы поднимаетесь, вдоль — спускаетесь). Экстремумом она не является ни в каком смысле, а градиент в ней ровно нулевой.

Теперь оценка, объясняющая, почему в глубоком обучении седла — это не курьёз, а норма. В стационарной точке поведение по каждому из $n$ независимых направлений можно грубо считать «вверх» или «вниз». Точка будет минимумом, только если все $n$ направлений смотрят вверх. Если считать направления примерно независимыми и равновероятными (это грубая, но полезная модель), вероятность такого совпадения порядка $2^{-n}$. При $n = 10$ это уже $\approx 0{,}001$, при $n = 10^6$ — число, для которого нет названия. Практически все стационарные точки в пространстве большой размерности — сёдла.

Это не только эвристика. В 2014 году Dauphin с соавторами («Identifying and attacking the saddle point problem in high-dimensional non-convex optimization») показали на теории случайных матриц и на экспериментах, что главный тормоз обучения глубоких сетей — не локальные минимумы, как считали до того, а именно седловые точки и окружающие их плоские области. Более того, там же обнаружилась закономерность: чем выше значение лосса в стационарной точке, тем вероятнее, что это седло; настоящие минимумы концентрируются внизу, около хорошего качества.

Практическое следствие: оптимизаторы с моментумом (SGD с momentum, Adam) выбираются из сёдел лучше, чем чистый градиентный спуск, — накопленная «инерция» проталкивает точку сквозь плоский участок в направлении спуска.

Плато и мёртвые ReLU: градиент почти ноль на целой области

Второй сценарий «нулевого градиента» — не точка, а целая область, где $\nabla L \approx 0$. Это плато. Формально там нет ни минимума, ни максимума в строгом смысле (все точки нестрого равны друг другу по значению), а практически обучение стоит: шаг $w \leftarrow w - \eta\nabla L$ при нулевом градиенте не меняет ничего.

Классический механизм — насыщение сигмоиды. Производная $\sigma'(z) = \sigma(z)(1-\sigma(z))$ достигает максимума $0{,}25$ в нуле и стремится к нулю при $|z| \to \infty$: при $z = 10$ она равна примерно $4{,}5\cdot 10^{-5}$. Нейрон «залип» в насыщении — градиент через него практически не проходит.

Второй механизм — мёртвый ReLU. Функция $\mathrm{ReLU}(z) = \max(0, z)$ имеет производную $0$ при $z<0$ и $1$ при $z>0$ (в нуле производной нет — тот самый излом из предыдущего раздела). Если после неудачного шага веса нейрона сдвинулись так, что предактивация отрицательна на всех примерах обучающей выборки, градиент по его весам равен нулю на всей выборке. Изменить веса нечем — нейрон мёртв навсегда. Лечение прямое: Leaky ReLU с наклоном $0{,}01$ слева, ELU, GELU — всё это способы не дать производной обнулиться полностью.

Посмотри, насколько это буквально задача из этого урока: у функции $f(w) = \big(\max(0,w)\big)^2$ производная равна $0$ на всём луче $w<0$, и каждая точка этого луча — нестрогий локальный экстремум. Именно нестрогость и делает «плато» плоским, а обучение — застрявшим.

Локальные минимумы: почему они реже проблема, чем кажется

Классический страх звучит так: «функция потерь невыпуклая, значит градиентный спуск застрянет в плохом локальном минимуме». Практика оказалась мягче теории. У больших переопределённых сетей локальные минимумы, до которых реально доходит SGD, дают качество, близкое к лучшему достижимому: работа Choromanska с соавторами (2015, «The Loss Surfaces of Multilayer Networks») показала, что с ростом размера сети значения лосса в локальных минимумах концентрируются в узком диапазоне и уходят вниз, к глобальному.

Ключевая причина — та же размерность, что порождала сёдла. Чтобы застрять в плохом минимуме, нужно, чтобы все миллион направлений вели вверх; в высокой размерности почти всегда находится хоть одно направление, ведущее вниз, и оптимизатор им пользуется. Так что честный ответ выглядит так: локальные минимумы в глубоком обучении существуют, но главные враги — сёдла, плато, овраги и плохая обусловленность.

Early stopping: намеренно не доходить до экстремума

И финальный поворот, который переворачивает всю рамку. Обучение модели вообще не обязано заканчиваться в стационарной точке. Стандартная практика — early stopping: следить за ошибкой на валидационной выборке и остановиться, когда она перестала падать, даже если тренировочный лосс продолжает уверенно снижаться.

С точки зрения математики это означает: мы сознательно останавливаемся в точке, где $\nabla L_{\text{train}} \neq 0$, то есть не в экстремуме. Причина в том, что минимизируемая функция (ошибка на обучающих данных) — не та функция, которая нас на самом деле интересует (ошибка на новых данных). Идти до конца по первой означает переобучиться и ухудшить вторую.

Отсюда красивый вывод, которым стоит закончить раздел: математика говорит, где находятся экстремумы, но не говорит, что до них обязательно надо доходить. Иногда самая лучшая точка — та, в которой производная ещё далека от нуля.

Почему это важно

Всё содержание этого раздела — одно одномерное утверждение, растянутое на миллион измерений: из $f'(x_0)=0$ не следует экстремум. В школьной задаче цена ошибки — потерянный балл, в обучении модели — недели GPU-времени и вывод «архитектура не работает» там, где на самом деле оптимизатор сидел на седле.

Отсюда рабочая диагностика, которую применяют инженеры. Лосс перестал падать, норма градиента близка к нулю — это ещё не «сошлось». Проверить стоит:

  • Не плато ли это (посмотреть на распределение активаций: не насытились ли сигмоиды, какая доля ReLU выдаёт ноль на всей выборке).
  • Не седло ли (добавить моментум или шум, посмотреть, сдвинется ли лосс).
  • Не слишком ли большой шаг (лосс скачет вокруг минимума, не попадая в него).
  • Не пора ли остановиться (что при этом делает валидационная метрика).

Каждый пункт этого списка — прямой перевод одного из случаев, которые ты разбирал в этом уроке на функциях одной переменной.


Практика: 30 заданий

Базовые (задания 1-10)

Задание 1: Найди точки экстремума и экстремумы функции $f(x) = x^2 - 6x + 11$.


Задание 2: Найди точки экстремума и экстремумы функции $f(x) = -x^2 + 8x - 3$.


Задание 3: Исследуй на экстремум функцию $f(x) = x^3 - 3x$.


Задание 4: Исследуй на экстремум функцию $f(x) = x^3 - 6x^2 + 9x$.


Задание 5: Исследуй на экстремум функцию $f(x) = 2x^3 + 3x^2 - 12x + 1$.


Задание 6: Найди все точки экстремума функции $f(x) = x^4 - 8x^2 + 3$.


Задание 7: Докажи, что у функции $f(x) = x^3 + 3x^2 + 3x + 1$ нет точек экстремума, хотя стационарная точка есть.


Задание 8: Найди точки экстремума функции $f(x) = x + \dfrac{1}{x}$.


Задание 9: Исследуй на экстремум функцию $f(x) = \dfrac{x}{x^2+1}$.


Задание 10: Найди точку экстремума функции $f(x) = |x-4| + 2$ и объясни, почему теорема Ферма здесь ничего не даёт.


Средние (задания 11-20)

Задание 11: Найди точки экстремума функции $f(x) = xe^{-x}$.


Задание 12: Исследуй на экстремум функцию $f(x) = x^2 e^{x}$.


Задание 13: Найди точку экстремума функции $f(x) = x\ln x$.


Задание 14: Исследуй на экстремум функцию $f(x) = x^2 - 8\ln x$.


Задание 15: Найди точки экстремума функции $f(x) = \sqrt{x} - x$. Отдельно объясни статус точки $x = 0$.


Задание 16: Исследуй на экстремум функцию $f(x) = \dfrac{x^2}{x-1}$.


Задание 17: Найди точки экстремума функции $f(x) = x^3(x-4)$ и объясни, что происходит в точке $x = 0$.


Задание 18: Найди все точки экстремума функции $f(x) = |x^2 - 4|$.


Задание 19: Исследуй на экстремум функцию $f(x) = \dfrac{e^x}{x}$.


Задание 20: Линейная модель без свободного члена предсказывает $\hat y = a x$. Обучающая выборка состоит из двух точек: $(x_1;y_1) = (1;1)$ и $(x_2;y_2) = (2;3)$. Функция потерь — сумма квадратов ошибок $L(a) = (a - 1)^2 + (2a - 3)^2$. Найди значение параметра $a$, при котором потери минимальны, и сами минимальные потери.


Продвинутые (задания 21-30)

Задание 21: При каких значениях параметра $a$ функция $f(x) = x^3 + ax^2 + 3x + 1$ имеет ровно две точки экстремума?


Задание 22: При каком значении параметра $a$ точка $x = 2$ является точкой максимума функции $f(x) = a\ln x - x^2$?


Задание 23: Про функцию $f$, определённую и непрерывную на всей прямой, известно, что её производная равна $f'(x) = (x+1)(x-2)^2(x-5)$. Найди точки экстремума $f$ и определи их тип.


Задание 24: Функция $f$ непрерывна на $\mathbb{R}$. Про её производную известно следующее: $f'$ отрицательна на $(-\infty;-3)$, обращается в ноль при $x=-3$, положительна на $(-3;1)$, обращается в ноль при $x=1$, снова положительна на $(1;4)$, обращается в ноль при $x=4$ и отрицательна на $(4;+\infty)$. Сколько у функции $f$ точек экстремума и каких?


Задание 25: Функция задана формулой

$$f(x) = \begin{cases} x^2 + 1, & x \neq 0,\\ 3, & x = 0.\end{cases}$$

Производная при $x \neq 0$ равна $2x$: слева от нуля она отрицательна, справа положительна. Означает ли это, что $x = 0$ — точка минимума?


Задание 26: Найди точки экстремума функции $f(x) = x\sqrt{1-x^2}$.


Задание 27: Докажи, что функция $f(x) = x^5 + 5x^3 + 10x - 3$ не имеет точек экстремума.


Задание 28: При обучении трёх разных моделей норма градиента функции потерь упала почти до нуля. Инженер провёл дополнительный эксперимент — сделал маленькие пробные шаги в разные стороны из текущей точки $w^{*}$ — и получил такие результаты. A: любой пробный шаг в любую сторону увеличивает лосс. B: шаги по одной группе направлений увеличивают лосс, по другой — уменьшают. C: шаги в любую сторону оставляют лосс практически прежним (изменения на уровне шума). Классифицируй каждый случай и предложи действие.


Задание 29: Вклад одного нейрона с ReLU в функцию потерь описывается функцией $f(w) = \big(\max(0,\,w)\big)^2$. Найди её критические точки, определи, где есть экстремумы и какого типа, и объясни, что это значит для обучения.


Задание 30: Функция $f(x) = x^3 + ax^2 + bx + 1$ имеет максимум в точке $x = -1$ и минимум в точке $x = 3$. Найди $a$ и $b$, а также сами экстремумы.


Частые ошибки

Ошибка 1: считать, что из $f'(x_0)=0$ следует экстремум

Неправильно: «$f(x) = x^3$, $f'(x) = 3x^2$, $f'(0)=0$, значит в нуле экстремум».

Правильно: $f'(x) = 3x^2 > 0$ при всех $x \neq 0$ — знак производной слева и справа одинаков, экстремума нет. Функция строго возрастает на всей прямой.

💡 Почему важно: это ошибка номер один во всей теме, и она возникает из-за путаницы между необходимым и достаточным условием. Теорема Ферма работает в одну сторону: экстремум ⟹ ноль производной. Обратной импликации нет. Найденная критическая точка — приглашение к проверке знаков, а не готовый ответ. Ровно та же ошибка в ML звучит как «norm(grad) ≈ 0, значит модель сошлась» — и стоит она уже не балла, а недели вычислений на седловой точке.


Ошибка 2: искать критические точки только уравнением $f'(x)=0$

Неправильно: «$f(x) = |x-3|$; решаем $f'(x)=0$; решений нет; значит экстремумов нет».

Правильно: производная равна $-1$ слева и $+1$ справа, в точке $x=3$ её нет — это критическая точка второго типа. Смена знака $-\to+$ даёт минимум $f(3)=0$.

💡 Почему важно: экстремум в точке излома — не редкость и не патология. На нём стоит вся $L_1$-регуляризация ($\lambda\sum|w_j|$) и MAE-лосс, а острый угол функции $|w|$ в нуле — прямая причина того, почему Lasso зануляет веса ровно в ноль, а не приблизительно. Полный список кандидатов всегда состоит из двух частей: нули производной и точки области определения, где производной нет.


Ошибка 3: путать точку экстремума и экстремум

Неправильно: «для $f(x) = (x-3)^2+1$ минимум функции равен $3$».

Правильно: точка минимума $x_{\min} = 3$ (это аргумент, ось $x$), а минимум функции $f_{\min} = f(3) = 1$ (это значение, ось $y$).

💡 Почему важно: это разные объекты, и вопросы про них разные: «в какой точке» и «чему равен». На экзамене формулировку читают буквально: если спросили экстремум, а вы назвали точку, ответ неверен, даже если решение идеально. Универсальная страховка — всегда писать обе величины: «$x_{\min} = 3$, $f_{\min} = 1$».


Ошибка 4: включать в ответ точки, не входящие в область определения

Неправильно: «для $f(x) = x + \frac{4}{x}$ производная $\frac{x^2-4}{x^2}$; критические точки $-2$, $2$ и $0$ (там производной нет)».

Правильно: $x = 0$ не входит в $D(f)$ — функция там не определена, значит это не критическая точка, а разрыв. Он разбивает прямую при построении таблицы, но кандидатом в экстремумы не является.

💡 Почему важно: определение критической точки начинается со слов «точка из области определения». Разрыв обязательно вносится в таблицу знаков (через него нельзя протягивать вывод о монотонности), но экстремума в нём быть не может — там нет значения функции, с которым можно было бы сравнивать соседей. Родственная ошибка — забыть проверить, что найденный корень уравнения $f'(x)=0$ вообще попадает в область: у $f(x)=x^2-8\ln x$ производная даёт корни $\pm 2$, но $-2$ отбрасывается.


Ошибка 5: применять правило смены знака в точке разрыва

Неправильно: для функции, равной $x^2$ при $x \neq 0$ и $3$ при $x=0$: «слева $f'<0$, справа $f'>0$, значит в нуле минимум».

Правильно: функция в нуле разрывна ($\lim_{x\to 0}f(x)=0$, а $f(0)=3$), достаточное условие неприменимо. По определению получается строгий локальный максимум со значением $3$.

💡 Почему важно: непрерывность в самой точке — не украшение формулировки, а рабочее условие. Разрыв может поднять или уронить точку относительно её окрестности и полностью перевернуть вывод. Проверка занимает одну строку: сравнить $\lim_{x\to x_0}f(x)$ с $f(x_0)$. Особенно внимательным надо быть с кусочно заданными функциями — именно там разрыв обычно и прячется.


Ошибка 6: путать локальный экстремум с наибольшим значением

Неправильно: «у $f(x)=x^3-3x$ локальный максимум равен $2$, значит наибольшее значение на отрезке $[-2;3]$ тоже $2$».

Правильно: $f(3) = 27-9 = 18 > 2$. Наибольшее значение на отрезке равно $18$ и достигается на конце, где никакого экстремума нет.

💡 Почему важно: локальность означает сравнение только с соседями, поэтому локальный максимум запросто бывает меньше значения в далёкой точке. Наибольшее значение ищется сравнением по списку «критические точки внутри + оба конца» (урок 142). Практический аналог: модель, обученная градиентным спуском, останавливается в локальном минимуме, и никакой гарантии, что это лучшее из возможного, у неё нет — отсюда рестарты и ансамбли.


Ошибка 7: терять корни чётной кратности при анализе знаков

Неправильно: «$f'(x) = 4x^2(x-3)$, критические точки $0$ и $3$, значит в обеих экстремум».

Правильно: множитель $x^2$ имеет чётную степень и знак не переворачивает: слева и справа от нуля производная отрицательна. В точке $0$ экстремума нет, экстремум только в $x=3$ (минимум).

💡 Почему важно: знак произведения меняется при переходе через корень нечётной кратности и не меняется при переходе через корень чётной. Автоматически ставить чередующиеся знаки $+,-,+,-$ по промежуткам — распространённая привычка, и на кратных корнях она даёт неверный ответ. Надёжный приём — выписать множители столбиком и определить знак каждого отдельно (как в задании 23), либо подставить пробные точки в саму производную.


Ошибка 8: объявлять концы области определения точками экстремума

Неправильно: «$f(x)=\sqrt{x}-x$ на $[0;+\infty)$; в точке $x=0$ производной нет, значит это точка экстремума».

Правильно: $x=0$ — граница области определения, двусторонней окрестности внутри $D(f)$ у неё нет, и точкой локального экстремума в принятом соглашении она не считается.

💡 Почему важно: теорема Ферма прямо оговаривает внутренние точки, и всё определение через окрестность на границе не работает. Это не значит, что граница неважна — при поиске наибольшего и наименьшего значения (урок 142) она проверяется обязательно и отдельным пунктом. В задачах с ограничениями (вероятность в $[0;1]$, неотрицательные веса) оптимум сплошь и рядом садится именно на границу, где градиент не нулевой.


Главное запомнить

📝 Ключевые понятия

Локальный максимум: существует окрестность $(x_0-\delta;x_0+\delta)$, в которой $f(x)\leqslant f(x_0)$. Для минимума — $f(x)\geqslant f(x_0)$. Ключевое слово «существует»: достаточно одного, сколь угодно маленького интервала.

Точка экстремума ≠ экстремум: точка экстремума — значение аргумента ($x$), экстремум — значение функции ($y$). В ответе называй оба: «$x_{\min}=3$, $f_{\min}=1$».

Локальность: экстремум сравнивает точку только с соседями. Локальный максимум может быть меньше значения функции в далёкой точке и меньше локального минимума на другой ветви.

Теорема Ферма (необходимое условие): если во внутренней точке $x_0$ дифференцируемая функция имеет экстремум, то $f'(x_0)=0$. Три оговорки: только внутренние точки, только там, где производная существует, и условие не достаточное.

Обратное неверно: $y=x^3$ в нуле — $f'(0)=0$, экстремума нет. Критические точки — список подозреваемых, а не виновных.

Достаточное условие: $f$ непрерывна в $x_0$ и дифференцируема в проколотой окрестности. Смена знака $f'$ с $+$ на $-$ — максимум; с $-$ на $+$ — минимум; знак не сменился — экстремума нет.

Непрерывность обязательна: у функции, равной $x^2$ при $x\neq 0$ и $3$ при $x=0$, знак меняется с $-$ на $+$, а точка $0$ — максимум, а не минимум. Разрыв переворачивает вывод.

Экстремум без производной: $y=|x|$ — минимум в изломе; $y=1-\sqrt[3]{x^2}$ — максимум с вертикальной касательной (острие); $y=\sqrt[3]{x}$ — производной нет, а экстремума нет тоже. Отсутствие производной ничего не решает, решает смена знака.

Полный список кандидатов: корни уравнения $f'(x)=0$ плюс точки области определения, где $f'$ не существует. Точки вне $D(f)$ (разрывы) в список не входят, но таблицу разбивают.

Алгоритм: область определения → $f'$ и разложение на множители → критические точки → таблица знаков с разрывами → вердикт по каждой точке → значения функции → ответ с точками и значениями.

Множители, не влияющие на знак: $e^{x}$, $e^{-x}$, $x^2$, $(x-a)^2$, $\sqrt{\ldots}$, любой полный квадрат в знаменателе. Отбрасывай их сразу — от страшной производной остаётся многочлен. Корень чётной кратности знак не переворачивает.

Экстремум ≠ наибольшее значение: первое локально и ищется сменой знака, второе глобально и ищется сравнением значений в критических точках и на концах (урок 142). Второй достаточный признак — через $f''$ — появится в уроке 143.

В ML: $\nabla L = 0$ — необходимое условие, не более. В большой размерности почти все стационарные точки — сёдла (доля минимумов падает как $2^{-n}$), плюс плато от насыщения сигмоид и мёртвых ReLU. «Норма градиента ≈ 0» не означает «модель обучилась».


Связь с другими темами курса

Что нужно было знать до этого урока:

  • Урок 133, определение производной — доказательство теоремы Ферма строится напрямую на разностном отношении и его односторонних пределах. Оттуда же понимание, почему у $|x|$ в нуле производной нет.
  • Урок 134, геометрический смысл производной — «горизонтальная касательная в точке экстремума» и «вертикальная касательная в точке острия» читаются только через связь производной и углового коэффициента.
  • Уроки 136-138, техника дифференцирования — без правила частного, правила произведения, цепного правила и таблицы производных не сосчитать $f'$ ни для дроби, ни для $x^2e^{-x}$, ни для $\frac{\ln x}{x}$.
  • Урок 139, критические точки и таблица знаков — оттуда взяты сами понятия критической и стационарной точки и техника разбиения прямой на промежутки. Этот урок отвечает на вопрос, который там был поставлен и оставлен открытым.
  • Урок 140, возрастание и убывание — достаточное условие выводится ровно из теоремы о монотонности: слева возрастает, справа убывает, значит в стыке вершина.

Что изучить дальше:

  • Урок 142, наибольшее и наименьшее значение функции — как от локальных экстремумов перейти к глобальным: добавить концы отрезка и сравнить значения. Все прикладные задачи оптимизации живут там.
  • Урок 143, выпуклость и точки перегиба — там появится вторая производная и вместе с ней второй достаточный признак экстремума: $f''(x_0)>0$ — минимум, $f''(x_0)<0$ — максимум. Быстрее в вычислениях, но применим не всегда.
  • Урок 144, построение графиков с помощью производной — экстремумы станут одним из пунктов полной схемы исследования вместе с асимптотами, промежутками монотонности и выпуклостью.
  • Урок 192, правило Лопиталя — техника вычисления пределов, часто нужная при исследовании поведения функции около критических точек и на бесконечности.

Где это нужно в жизни:

💻 В программировании: численные оптимизаторы (scipy.optimize.minimize, метод Ньютона, градиентный спуск) построены на поиске стационарных точек с проверкой типа. Подбор гиперпараметров, автотюнинг производительности, поиск оптимального размера кэша — всё это поиск экстремума функции, заданной не формулой, а измерением.

🤖 В машинном обучении: обучение модели — это минимизация функции потерь. Различение минимума, седла и плато определяет выбор оптимизатора (моментум против чистого SGD), архитектуры (ReLU против сигмоиды), стратегии остановки (early stopping). Максимум правдоподобия в статистических моделях — тоже задача на экстремум.

📊 В анализе данных: пик функции плотности — мода распределения, находится как точка максимума. Выбор порога классификации по максимуму F1-меры, точка максимального прироста метрики при увеличении выборки (learning curve), оптимальное число кластеров по «локтю» — везде поиск экстремума.

🔬 В науке и инженерии: устойчивое положение системы — минимум потенциальной энергии, неустойчивое — максимум. Резонансная частота — максимум амплитуды. Оптимальный угол броска, минимальное время прохождения луча (принцип Ферма в оптике — исторически та же задача, что и наша теорема), максимум КПД двигателя.

💰 В экономике и бизнесе: оптимальная цена (максимум выручки — та самая «золотая середина» между «дорого, но мало покупают» и «дёшево, но мало зарабатываем»), размер партии с минимальными издержками, точка максимальной маржинальности, оптимальная доля рекламного бюджета.


Интересные факты

💡 Кеплер открыл экстремумы, ругаясь с продавцом вина. В 1615 году Иоганн Кеплер купил бочку вина и обнаружил, что торговец меряет объём одной палкой, вставленной наискось через отверстие. Возмутившись методикой, Кеплер написал целую книгу — «Новую стереометрию винных бочек». В ней он заметил, что у оптимальной формы бочки объём почти не меняется при небольших изменениях размеров: «около максимума приращение исчезающе мало». Это ровно наше $f'(x_0)=0$, сформулированное за четырнадцать лет до Ферма и без единой производной.

💡 Метод Ферма был объявлен ошибочным — и его автор оказался прав. Получив рукопись через Мерсенна в 1638 году, Декарт разнёс метод адекватирования в пух и прах: делить на $e$, а потом объявлять $e$ нулём — это, по его мнению, было жульничеством. Формально Декарт был прав, строгости там не было никакой. Но Ферма ответил разбором задач, которые декартовым методом не решались, и спор закончился в его пользу. Лагранж полтора века спустя написал, что именно Ферма следует считать первым изобретателем дифференциального исчисления.

💡 Тот же Ферма и тот же принцип — в оптике. Принцип Ферма гласит: свет между двумя точками идёт по пути, на который тратит экстремальное время. Из этого одного утверждения выводятся и закон отражения, и закон преломления Снеллиуса. Интересна деталь: не всегда минимальное время — бывают конфигурации (например, отражение от вогнутого зеркала), где реальный путь даёт локальный максимум. Правильная формулировка — именно «стационарная точка», то есть та, где производная равна нулю. Ошибка «экстремум = минимум» имеет солидную историю в физике.

💡 Долю сёдел посчитали через теорию случайных матриц. Идея, что в высокой размерности минимумы редки, — не догадка, а результат. Bray и Dean (2007), а затем Dauphin с соавторами (2014) применили аппарат случайных матриц к ландшафту функции потерь и показали: доля стационарных точек, являющихся минимумами, экспоненциально мала по размерности, и минимумы концентрируются внизу — при малых значениях лосса. Практический вывод перевернул методику: до 2014 года в застревании обучения винили локальные минимумы, после — седловые точки и плато.

💡 Иногда правильный ответ — не доходить до экстремума. Early stopping останавливает обучение в точке, где градиент тренировочного лосса заведомо не ноль. Это не компромисс от бедности, а сознательный выбор: минимизируемая функция (ошибка на обучающей выборке) — не та, которая нужна (ошибка на новых данных). Более того, ранняя остановка математически близка к $L_2$-регуляризации: для линейной модели их эффект на веса совпадает при определённом подборе параметров. Ограничение времени спуска работает как штраф за большие веса.


Лайфхаки и полезные трюки

1. Отбрасывай множители, которые не могут менять знак

Прежде чем строить таблицу, посмотри на производную и вычеркни всё, что положительно при любом $x$: $e^{x}$, $e^{-x}$, $x^2$ (кроме самой точки $0$), $(x-a)^2$, $\sqrt{\ldots}$, квадрат в знаменателе. От страшной формулы остаётся простой многочлен.

Пример: $f'(x) = \dfrac{e^x(x-1)}{x^2}$ — знак полностью определяется скобкой $(x-1)$. Таблица строится за пять секунд без единого вычисления.


2. Проверяй знак пробной точкой, а не рассуждением

Подставить $x=0$ или $x=10$ в производную быстрее и надёжнее, чем рассуждать про знаки множителей в уме. Бери число подальше от критических точек и поудобнее для арифметики.

Пример: $f'(x) = 3(x-2)(x+1)$, проверяем промежуток $(2;+\infty)$ точкой $x=10$: $3\cdot 8\cdot 11 > 0$ — знак плюс. Ни одного шанса ошибиться в уме.


3. Помни правило кратности корня

Знак произведения меняется при переходе через корень нечётной кратности и не меняется при переходе через корень чётной. Это спасает от автоматической расстановки чередующихся знаков.

Пример: $f'(x) = (x+1)(x-2)^2(x-5)$ — точка $x=2$ пустышка, знаки идут $+,\ -,\ -,\ +$, а не $+,\ -,\ +,\ -$. Экстремумов два, а нулей производной три.


4. Сначала область определения, потом всё остальное

Пиши $D(f)$ первой строкой решения, всегда. Это отсекает лишние корни (у $x^2-8\ln x$ корень $-2$ не годится), напоминает про разрывы в таблице и не даёт назвать экстремумом точку, где функции нет.

Пример: $f(x) = \frac{x^2}{x-1}$ — сразу видно, что $x=1$ пойдёт в таблицу как разрыв, а не как кандидат, и что вывод о монотонности через неё протягивать нельзя.


5. Проверяй ответ тремя числами

Нашёл минимум в точке $x_0$? Посчитай $f(x_0-0{,}1)$, $f(x_0)$, $f(x_0+0{,}1)$. Для минимума среднее число должно быть наименьшим, для максимума — наибольшим. Тридцать секунд арифметики ловят почти любую ошибку в знаках.

Пример: для $f(x)=x^3-3x$ проверяем найденный максимум в $x=-1$: $f(-1{,}1)=-1{,}331+3{,}3=1{,}969$, $f(-1)=2$, $f(-0{,}9)=-0{,}729+2{,}7=1{,}971$. Среднее наибольшее ✅ Если бы знаки перепутались, это вылезло бы мгновенно.


6. У квадратного трёхчлена в производной знаки всегда «$+,-,+$» или «$-,+,-$»

Если $f'(x) = A(x-x_1)(x-x_2)$ с $A>0$ и $x_1

Пример: $f'(x) = 6(x+2)(x-1)$ — сразу пишем: $x=-2$ максимум, $x=1$ минимум. Осталось посчитать значения.


7. В задачах с параметром сначала необходимое условие, потом обязательная проверка

Условие $f'(x_0)=0$ даёт уравнение на параметр — это половина решения. Вторая половина: подставить найденное значение и проверить, что смена знака действительно даёт нужный тип экстремума. Без проверки решение неполно, и в части задач ответ оказывается лишним.

Пример: в задании 22 из $f'(2)=0$ получилось $a=8$, но пока не проверили знаки $\frac{2(2-x)(2+x)}{x}$, не было известно, максимум это или минимум.


8. Ищи в формуле свёртку — она может убить все экстремумы разом

Прежде чем дифференцировать кубический многочлен, посмотри, не является ли он полным кубом или строго монотонной суммой нечётных степеней. Такие функции экстремумов не имеют вовсе.

Пример: $x^3+3x^2+3x+1 = (x+1)^3$ — производная $3(x+1)^2$ неотрицательна, экстремумов нет. То же с $x^5+5x^3+10x-3$: производная $5(x^2+1)(x^2+2)>0$, и вся задача решается в две строки без всякой таблицы.


💡 Совет: доведи до автоматизма связку «критическая точка → знак слева → знак справа → вердикт». Не «понимать в принципе», а выполнять не задумываясь, как таблицу умножения. Проверить себя просто: возьми пять любых заданий из среднего блока и реши с чистого листа за пятнадцать минут, каждый раз выписывая область определения первой строкой и завершая ответ и точкой, и значением.

И держи в голове главную мысль урока — она стоит всех выкладок: нулевая производная ничего не доказывает, доказывает только смена знака. Из этого одного факта следует и школьная аккуратность (не объявлять $x^3$ имеющей экстремум в нуле), и инженерная зоркость (не верить строчке «gradient norm ≈ 0» в логе обучения), и понимание, почему оптимизаторы устроены так, как устроены. Умение отличить настоящую вершину от места, где график просто на секунду выположился, — навык, который отделяет решение задачи от угадывания.

В следующем уроке — 142, наибольшее и наименьшее значение функции — мы возьмём найденные экстремумы и научимся выбирать среди них лучший, добавив к списку кандидатов концы отрезка. Там же появятся настоящие прикладные задачи на оптимизацию: какой формы делать коробку, где ставить склад, при какой цене выручка максимальна. Переходи — теория закончилась, начинается польза.

Понял тему? Закрепи в боте! 🚀

Попрактикуйся на задачах и получи персональные рекомендации от AI

💪 Начать тренировку
💬 Есть вопрос? Спроси бота!