Возрастание и убывание функции 📈
Представь, что ты сдаёшь модель кредитного скоринга на приёмку в банк. Метрики отличные: ROC-AUC 0,84, калибровка ровная, на отложенной выборке всё держится. И тут риск-менеджер задаёт один вопрос: «А если у клиента вырастет доход, его балл может упасть?» Ты идёшь проверять — и обнаруживаешь, что да, может. Где-то в районе дохода 8 миллионов в год бустинг поймал шум на трёх наблюдениях и загнул зависимость вниз. Модель отправляется на доработку, потому что банк не имеет права объяснять клиенту: «вы стали зарабатывать больше, поэтому мы дали вам меньший лимит».
То, что от модели потребовали, называется монотонностью. Это одно из самых простых свойств функции — «растёт» или «падает» — и одновременно одно из самых востребованных: на нём держатся обратимость, единственность корня уравнения, корректность перехода от правдоподобия к логарифму правдоподобия и половина здравого смысла в прикладных моделях.
В уроке 139 ты уже познакомился со связкой «знак $f'$ ↔ поведение функции» и научился строить таблицу знаков. Сейчас мы возьмём эту связку и доведём её до рабочего инструмента: разберёмся, что именно значит «возрастает», почему это свойство промежутка, а не точки, какая теорема разрешает делать вывод по знаку производной и при каких условиях, что делать, когда производная где-то обращается в ноль, и — отдельная больная тема — как записать ответ так, чтобы он был математически верным, а не только похожим на верный.
🎯 Ты узнаешь:
- Строгие определения возрастания и убывания на языке «$x_1 < x_2 \Rightarrow f(x_1) < f(x_2)$» и чем от них отличаются неубывающая и невозрастающая функции
- Почему монотонность нельзя приписать точке, и как выглядит функция, которая «возрастает в точке», но не возрастает ни на каком промежутке вокруг неё
- Достаточный признак монотонности — с честным перечислением условий и с идеей доказательства через теорему Лагранжа
- Почему из строгого возрастания не следует $f' > 0$, и как выглядит правильная формулировка признака с нулями производной
- Пошаговый алгоритм поиска промежутков монотонности — на многочлене, на дроби и на функции с логарифмом
- Как оформлять ответ: почему $\left(-\infty;0\right)\cup\left(0;+\infty\right)$ — это ошибка, и когда концы промежутка можно включать
- Где монотонность работает в ML: активации, log-likelihood, изотоническая регрессия и monotonic constraints в градиентном бустинге
История: откуда это взялось?
Слова «возрастает» и «убывает» кажутся настолько бытовыми, что трудно поверить: их точный математический смысл сформулировали довольно поздно. Ньютон и Лейбниц в конце XVII века свободно рассуждали о том, что «величина растёт», опираясь на механическую интуицию — точка движется, ордината увеличивается. Никакого определения через пару точек $x_1 < x_2$ у них не было и не требовалось: анализ той эпохи был языком описания движения, а не системой строгих утверждений.
Связь монотонности с производной впервые появилась в явном виде у Жозефа Луи Лагранжа в «Теории аналитических функций» (1797). Именно Лагранж доказал ту самую теорему о среднем, из которой достаточный признак монотонности следует в одну строчку: если на отрезке производная всюду положительна, то приращение функции обязано быть положительным. Он же ввёл обозначение $f'(x)$, которым мы пользуемся до сих пор. Правда, само доказательство Лагранжа опиралось на предположение, что любую функцию можно разложить в степенной ряд — предположение, которое позже оказалось ложным, и теорему пришлось доказывать заново.
Строгую версию навёл Огюстен Луи Коши в «Курсе анализа» (1821) и «Резюме лекций» (1823), заменив рассуждения о рядах аккуратной работой с пределами. А окончательную точку поставил Карл Вейерштрасс во второй половине XIX века — вместе со своей знаменитой функцией, непрерывной всюду и не имеющей производной ни в одной точке. После неё стало ясно: наивная картинка «график — это линия, которую можно нарисовать карандашом, и её наклон видно глазами» ничего не гарантирует. Определения должны формулироваться через неравенства, а не через рисунок.
Мостик в сегодня получается прямой. Когда в 1955 году статистики Эйерс, Брунк, Юинг, Рид и Силверман опубликовали работу об оценивании при упорядоченных ограничениях, они решали ровно ту задачу, с которой начался этот урок: подогнать к данным монотонную функцию, потому что содержательно зависимость обязана быть монотонной. Их алгоритм PAVA (pool adjacent violators) до сих пор лежит в sklearn.isotonic.IsotonicRegression и используется для калибровки вероятностей в каждом втором продакшн-пайплайне.
Что такое возрастание: определение через пару точек
Интуиция: два столбика в таблице
Представь, что у тебя есть таблица: в левом столбце аргумент, в правом — значение функции. Ты сортируешь строки по левому столбцу, по возрастанию. Смотришь на правый столбец. Если он тоже оказался отсортирован по возрастанию — функция возрастает. Если он отсортирован в обратном порядке — убывает. Если порядок в правом столбце «рваный» — функция не монотонна.
Это буквально определение, только без формул. Вся его суть — в сохранении порядка: функция либо сохраняет порядок между аргументами, либо переворачивает его.
Определение: Функция $f$ называется возрастающей (строго возрастающей) на промежутке $I$, если для любых $x_1, x_2 \in I$ из неравенства $x_1 < x_2$ следует $f(x_1) < f(x_2)$.
Функция $f$ называется убывающей (строго убывающей) на промежутке $I$, если для любых $x_1, x_2 \in I$ из неравенства $x_1 < x_2$ следует $f(x_1) > f(x_2)$.
Обрати внимание на два слова, которые обычно проскакивают мимо глаз: «для любых». Не для каких-то, не для соседних, не для тех, что ты проверил, — для всех пар сразу. Именно поэтому проверить возрастание перебором точек невозможно в принципе: пар бесконечно много.
Кроме строгих версий есть нестрогие — и в прикладных задачах они встречаются даже чаще.
Определение: Функция $f$ называется неубывающей на промежутке $I$, если из $x_1 < x_2$ следует $f(x_1) \le f(x_2)$; и невозрастающей, если из $x_1 < x_2$ следует $f(x_1) \ge f(x_2)$.
Функция, обладающая любым из этих четырёх свойств, называется монотонной на $I$. Строго возрастающая и строго убывающая называются строго монотонными.
Разница между «возрастающей» и «неубывающей» ровно одна: неубывающей разрешено иметь горизонтальные участки. Она не обязана расти всё время — ей запрещено только падать. Классический пример из ML — ReLU: на отрицательной полуоси она тождественно равна нулю, дальше растёт линейно. Падений нет нигде, значит она неубывающая на всей прямой, но строго возрастающей её назвать нельзя: $f(-5) = f(-1) = 0$, хотя $-5 < -1$.
Примеры с разбором
Пример 1 (простой). Докажем прямо по определению, что $f(x) = 3x + 2$ возрастает на $\mathbb{R}$.
Берём любые $x_1 < x_2$ и считаем разность значений:
$$f(x_2) - f(x_1) = (3x_2 + 2) - (3x_1 + 2) = 3(x_2 - x_1).$$Из $x_1 < x_2$ следует $x_2 - x_1 > 0$, а значит и $3(x_2 - x_1) > 0$. Получили $f(x_2) - f(x_1) > 0$, то есть $f(x_1) < f(x_2)$.
Ответ: функция возрастает на $\mathbb{R}$ по определению — производная тут вообще не понадобилась.
Пример 2 (средний). Разберём $f(x) = x^2$.
Возьмём произвольные $x_1 < x_2$ и разложим разность на множители:
$$f(x_2) - f(x_1) = x_2^2 - x_1^2 = (x_2 - x_1)(x_2 + x_1).$$Первый множитель положителен всегда (мы выбрали $x_1 < x_2$). Знак всей разности определяется вторым множителем $x_1 + x_2$:
- если обе точки взяты из $[0;+\infty)$, то $x_1 + x_2 \ge 0$, причём ноль возможен только при $x_1 = x_2 = 0$ — а такой пары у нас нет, ведь $x_1 < x_2$. Значит разность строго положительна: функция возрастает;
- если обе точки из $(-\infty;0]$, то $x_1 + x_2 \le 0$ и по той же причине строго отрицательна: функция убывает;
- если $x_1 = -3$, $x_2 = 1$ (точки из разных половин), то $f(-3) = 9 > 1 = f(1)$ — порядок нарушен.
Ответ: $f(x) = x^2$ убывает на $(-\infty;0]$, возрастает на $[0;+\infty)$ и не монотонна на $\mathbb{R}$.
Пример 3 (сложный). Покажем, что ReLU $f(x) = \max(x, 0)$ неубывающая на $\mathbb{R}$, но не возрастающая.
Возьмём $x_1 < x_2$ и разберём три случая:
- оба неположительны: $f(x_1) = f(x_2) = 0$, разность равна нулю — условие $\le$ выполнено, условие $<$ нет;
- оба положительны: $f(x_2) - f(x_1) = x_2 - x_1 > 0$;
- $x_1 \le 0 < x_2$: $f(x_1) = 0 < x_2 = f(x_2)$.
Во всех трёх случаях $f(x_1) \le f(x_2)$, значит функция неубывающая. А первый случай сразу даёт контрпример к строгому возрастанию: $f(-5) = f(-1) = 0$.
Ответ: ReLU неубывающая на $\mathbb{R}$, строго возрастающая на $[0;+\infty)$, постоянная на $(-\infty;0]$.
Почему это важно
Определение через пару точек — единственное, что у нас есть по-настоящему. Всё остальное (признак по производной, приёмы с композицией, таблицы знаков) — это способы не проверять бесконечное число пар вручную. Но когда инструмент отказывает — функция не дифференцируема, задана кусочно или вообще таблично, — возвращаться приходится именно сюда, к разности $f(x_2) - f(x_1)$.
И ещё одно. В ML разница между строгой и нестрогой монотонностью часто оказывается принципиальной. Нейросеть с ReLU может «убить» нейрон — он навсегда останется в нулевой зоне, где функция постоянна, и градиент через него не пойдёт. Это прямое следствие того, что ReLU неубывающая, но не строго возрастающая. Сигмоида строго возрастает и мёртвых нейронов не создаёт — зато создаёт затухающие градиенты (урок 137). Выбор активации — это в том числе выбор между этими двумя видами монотонности.
Монотонность — свойство промежутка, а не точки
Интуиция: одной точки недостаточно
Соблазн сказать «функция возрастает в точке $x_0$» огромен, особенно когда $f'(x_0) > 0$. Кажется, что если в точке скорость положительна, то функция там растёт — и всё.
Так вот: определение возрастания требует пару точек. Одна точка не образует пары. На множестве из одной точки любая функция формально и возрастает, и убывает одновременно — потому что подходящих пар просто нет и проверять нечего. Поэтому фраза «возрастает в точке» без дополнительных пояснений бессмысленна, а с пояснениями означает что-то другое, чем кажется.
Есть техническое понятие «возрастание в точке»: функция возрастает в точке $x_0$, если найдётся такая окрестность, что слева от $x_0$ значения меньше $f(x_0)$, а справа — больше. Это не то же самое, что «возрастает на окрестности $x_0$». И самое поразительное: из положительной производной в точке следует первое, но не следует второе.
Утверждение: Существует функция, для которой $f'(0) = 1 > 0$, но которая не является возрастающей ни на каком промежутке, содержащем ноль.
Примеры с разбором
Пример 1 (простой). $f(x) = x^2$ — уже разобрана выше, и она отлично показывает, что монотонность привязана к промежутку. На $[0;+\infty)$ функция возрастает, на $(-\infty;0]$ убывает. Спрашивать «а возрастает ли она в точке $x = 2$?» — некорректно; корректно спрашивать «возрастает ли она на промежутке $(1;3)$?» — да.
Ответ: одна и та же функция на разных промежутках ведёт себя по-разному; без указания промежутка вопрос о монотонности не имеет смысла.
Пример 2 (средний). $f(x) = \dfrac{1}{x}$ на $(-\infty;0)$ и на $(0;+\infty)$.
Производная $f'(x) = -\dfrac{1}{x^2} < 0$ всюду, где функция определена. Значит, на каждом из двух промежутков функция убывает.
Проверим определение на первом промежутке: пусть $x_1 < x_2 < 0$. Тогда
$$f(x_2) - f(x_1) = \frac{1}{x_2} - \frac{1}{x_1} = \frac{x_1 - x_2}{x_1 x_2}.$$Числитель $x_1 - x_2 < 0$, знаменатель $x_1x_2 > 0$ (оба множителя отрицательны). Дробь отрицательна — функция убывает ✅
А теперь возьмём $x_1 = -1$ и $x_2 = 1$ — точки из разных промежутков. Получаем $f(-1) = -1$ и $f(1) = 1$: меньшему аргументу соответствует меньшее значение. Убывания нет.
Ответ: $f(x)=\frac1x$ убывает на $(-\infty;0)$ и убывает на $(0;+\infty)$, но не убывает на объединении этих промежутков. Точка разрыва разрывает и монотонность.
Пример 3 (сложный). Разберём словесно ту самую функцию-контрпример:
$$g(x) = x + 2x^2\sin\frac{1}{x} \quad (x \ne 0), \qquad g(0) = 0.$$Что здесь происходит. Слагаемое $x$ — обычная возрастающая прямая. Слагаемое $2x^2\sin\frac1x$ — это быстро колеблющаяся добавка: синус бесконечно много раз пробегает от $-1$ до $1$ при приближении к нулю, а множитель $2x^2$ прижимает амплитуду колебаний к нулю.
Посчитаем производную в нуле по определению (урок 133):
$$g'(0) = \lim_{h\to 0}\frac{g(h) - g(0)}{h} = \lim_{h\to 0}\frac{h + 2h^2\sin\frac1h}{h} = \lim_{h\to 0}\left(1 + 2h\sin\frac1h\right) = 1,$$потому что $\left|2h\sin\frac1h\right| \le 2|h| \to 0$. Итак, $g'(0) = 1 > 0$.
А теперь производная в остальных точках, по правилам из уроков 136–138:
$$g'(x) = 1 + 4x\sin\frac1x - 2\cos\frac1x.$$Подставим точки вида $x_n = \dfrac{1}{2\pi n}$. Там $\sin\frac1x = \sin(2\pi n) = 0$, а $\cos\frac1x = \cos(2\pi n) = 1$, поэтому
$$g'(x_n) = 1 + 0 - 2 = -1 < 0.$$Такие точки есть в любой, сколь угодно маленькой окрестности нуля — достаточно взять $n$ побольше. А в точках вида $\dfrac{1}{\pi(2n+1)}$ производная равна $1 + 0 + 2 = 3 > 0$. Значит, около нуля производная бесконечно много раз меняет знак, и функция бесконечно много раз дёргается вверх-вниз. Ни на каком промежутке, содержащем ноль, она не возрастает.
Ответ: $g'(0) = 1 > 0$, но $g$ не возрастает ни на одном промежутке вокруг нуля. Положительность производной в одной точке ничего не даёт; признак монотонности требует положительности на всём промежутке. Причина сбоя: производная $g'$ разрывна в нуле.
Почему это важно
Этот пример — прививка от самой распространённой логической ошибки в теме. Формулировка «если $f'(x_0) > 0$, то функция возрастает около $x_0$» звучит абсолютно естественно, встречается в конспектах и является ложной. Правильная формулировка всегда про промежуток: «если $f' > 0$ на всём интервале, то на нём функция возрастает».
В ML тот же принцип работает буквально. Один замер градиента в одной точке ничего не говорит о поведении лосса в окрестности: шаг оптимизатора может увести в область, где всё устроено иначе. Именно поэтому learning rate подбирают, а не вычисляют, и именно поэтому существуют методы с линейным поиском по направлению — они проверяют поведение функции на целом отрезке, а не доверяют одной производной.
Достаточный признак: знак производной решает
Интуиция: спидометр и одометр
Ты едешь на машине. Спидометр показывает скорость — это производная координаты по времени (урок 135). Одометр показывает пройденный путь — это сама функция. Если весь час спидометр показывал строго положительное число, может ли одометр в конце часа показать меньше, чем в начале? Разумеется, нет: чтобы вернуться назад, нужно хотя бы на мгновение поехать назад, то есть иметь отрицательную скорость.
Вот и всё содержание теоремы. Положительная скорость на всём промежутке означает движение только вперёд.
Теорема (достаточный признак монотонности): Пусть функция $f$ непрерывна на отрезке $[a;b]$ и дифференцируема на интервале $(a;b)$. Тогда:
- если $f'(x) > 0$ для всех $x \in (a;b)$, то $f$ строго возрастает на $[a;b]$;
- если $f'(x) < 0$ для всех $x \in (a;b)$, то $f$ строго убывает на $[a;b]$;
- если $f'(x) = 0$ для всех $x \in (a;b)$, то $f$ постоянна на $[a;b]$.
Обрати внимание на асимметрию условий: непрерывность требуется на замкнутом отрезке, включая концы, а дифференцируемость — только внутри. Это не придирка. Именно эта асимметрия позволяет включать в промежуток монотонности точки, где производной нет, но функция непрерывна — например, концы области определения у $\sqrt{x}$ или у $\sqrt{x^2-9}$.
Откуда теорема берётся
Честное доказательство опирается на теорему Лагранжа о среднем значении, которую мы будем подробно разбирать в университетском блоке (урок 190). Забегать вперёд и пользоваться ею как готовым инструментом мы не станем, но идею стоит понять сейчас — она короткая и красивая.
Теорема Лагранжа формализует ровно то, что ты и так знаешь из урока 135: средняя скорость на отрезке обязательно совпадает с мгновенной скоростью в какой-то точке этого отрезка. Проехал 120 км за 2 часа — средняя скорость 60 км/ч, и был момент, когда спидометр показывал ровно 60. На языке формул: для любых $x_1 < x_2$ найдётся точка $c \in (x_1;x_2)$, такая что
$$\frac{f(x_2) - f(x_1)}{x_2 - x_1} = f'(c).$$Слева — средняя скорость изменения функции на отрезке, справа — мгновенная в некоторой внутренней точке.
Дальше вывод занимает одну строчку. Умножим обе части на $x_2 - x_1 > 0$:
$$f(x_2) - f(x_1) = f'(c)\,(x_2 - x_1).$$Если $f' > 0$ на всём интервале, то $f'(c) > 0$ — какой бы ни оказалась эта неизвестная точка $c$. Произведение двух положительных чисел положительно, значит $f(x_2) - f(x_1) > 0$, то есть $f(x_1) < f(x_2)$. Пара $x_1 < x_2$ была произвольной — определение возрастания выполнено.
Ключевой момент, ради которого этот вывод стоит держать в голове: точка $c$ лежит между $x_1$ и $x_2$, и мы не знаем, где именно. Поэтому нам и нужна положительность производной сразу на всём промежутке — тогда неважно, куда попадёт $c$. Как только на промежутке появляется хоть одна точка с отрицательной производной, гарантия исчезает.
Примеры с разбором
Пример 1 (простой). $f(x) = 2x^3 + 3x^2 - 12x + 1$.
Шаг 1. $D(f) = \mathbb{R}$.
Шаг 2. $f'(x) = 6x^2 + 6x - 12 = 6(x^2 + x - 2) = 6(x+2)(x-1)$.
Шаг 3. Нули производной: $x = -2$ и $x = 1$.
Шаг 4. Знаки по пробным точкам: $f'(-3) = 6\cdot(-1)\cdot(-4) = 24 > 0$; $f'(0) = 6\cdot 2\cdot(-1) = -12 < 0$; $f'(2) = 6\cdot 4\cdot 1 = 24 > 0$.
| $x$ | $(-\infty;-2)$ | $-2$ | $(-2;1)$ | $1$ | $(1;+\infty)$ |
|---|---|---|---|---|---|
| $f'(x)$ | $+$ | $0$ | $-$ | $0$ | $+$ |
| $f(x)$ | ↗ | ↘ | ↗ |
Ответ: возрастает на $(-\infty;-2]$ и на $[1;+\infty)$, убывает на $[-2;1]$.
Пример 2 (средний). $f(x) = e^x - x$.
Шаг 1. $D(f) = \mathbb{R}$.
Шаг 2. $f'(x) = e^x - 1$ (таблица производных, урок 138).
Шаг 3. $e^x - 1 = 0 \Leftrightarrow e^x = 1 \Leftrightarrow x = 0$.
Шаг 4. При $x < 0$ имеем $e^x < 1$, значит $f' < 0$. При $x > 0$ — $e^x > 1$, значит $f' > 0$. Экспонента монотонна, поэтому пробные точки даже не нужны.
Ответ: убывает на $(-\infty;0]$, возрастает на $[0;+\infty)$. Попутно получаем классическое неравенство: наименьшее значение $f(0) = 1$, откуда $e^x \ge x + 1$ для всех $x$ — то самое неравенство, которым в статистике оценивают KL-дивергенцию.
Пример 3 (сложный). $f(x) = \dfrac{x^2}{x-1}$.
Шаг 1. $D(f) = (-\infty;1)\cup(1;+\infty)$.
Шаг 2. По правилу производной частного (урок 136):
$$f'(x) = \frac{2x(x-1) - x^2\cdot 1}{(x-1)^2} = \frac{2x^2 - 2x - x^2}{(x-1)^2} = \frac{x^2-2x}{(x-1)^2} = \frac{x(x-2)}{(x-1)^2}.$$Шаг 3. Нули производной: $x = 0$ и $x = 2$. В точке $x = 1$ производная не существует — но и функция там не определена, так что критической точкой она не является (урок 139). При этом прямую она всё равно разбивает.
Шаг 4. Знаменатель $(x-1)^2 > 0$ везде в области определения — вычёркиваем его из анализа знаков. Остаётся $x(x-2)$.
| $x$ | $(-\infty;0)$ | $0$ | $(0;1)$ | $1$ | $(1;2)$ | $2$ | $(2;+\infty)$ |
|---|---|---|---|---|---|---|---|
| $x(x-2)$ | $+$ | $0$ | $-$ | $-$ | $0$ | $+$ | |
| $f(x)$ | ↗ | ↘ | разрыв | ↘ | ↗ |
Проверим числами: $f(-1) = \frac{1}{-2} = -0{,}5$, $f(0) = 0$ — росло ✅ $f(0{,}5) = \frac{0{,}25}{-0{,}5} = -0{,}5$ — упало ✅ $f(1{,}5) = \frac{2{,}25}{0{,}5} = 4{,}5$, $f(2) = 4$ — упало ✅ $f(3) = \frac{9}{2} = 4{,}5$ — выросло ✅
Ответ: возрастает на $(-\infty;0]$ и на $[2;+\infty)$, убывает на $[0;1)$ и на $(1;2]$. Промежутки $(0;1)$ и $(1;2)$ записываются раздельно, хотя на обоих функция убывает: через точку разрыва вывод о монотонности не переносится.
Почему это важно
Достаточный признак превращает задачу «проверить бесконечное число пар точек» в задачу «решить неравенство $f'(x) > 0$». Это гигантская экономия: неравенство решается алгоритмически, за конечное число шагов.
Слово «достаточный» в названии — не украшение. Условие $f' > 0$ гарантирует возрастание, но обратное неверно, и следующий раздел ровно про это. Кроме того, у теоремы есть условия, и их нарушение ломает вывод: разрыв в середине промежутка (пример 3) или отсутствие дифференцируемости во внутренней точке. Проверяй область определения до того, как пишешь ответ.
Обратное неверно: $y = x^3$ и нули производной
Интуиция: мгновенная остановка — не остановка
Представь машину, которая едет вперёд и на одну-единственную бесконечно короткую долю секунды показывает на спидометре ноль — а потом снова разгоняется. Ехала ли она вперёд всё это время? Да. Одометр всё время рос? Тоже да. Мгновенный ноль скорости не отменяет движения вперёд, потому что «постоять» на нём нельзя — это одна точка, а не промежуток.
Именно так устроен $y = x^3$ в нуле.
Разбор. Функция $f(x) = x^3$ строго возрастает на всей числовой прямой — это видно прямо из определения: если $x_1 < x_2$, то $x_1^3 < x_2^3$ (кубический корень монотонен, куб взаимно однозначен и сохраняет порядок). Проверим на числах: $(-2)^3 = -8 < (-1)^3 = -1 < 0 < 1 < 8$.
При этом $f'(x) = 3x^2$, и $f'(0) = 0$.
Вывод: из строгого возрастания не следует $f'(x) > 0$ во всех точках. Максимум, что следует, — это $f'(x) \ge 0$. Значит, признак «$f'>0$» достаточный, но не необходимый.
Отсюда рождается более сильная и более удобная формулировка.
Теорема (усиленный признак): Пусть $f$ непрерывна на промежутке $I$ и дифференцируема внутри него. Если $f'(x) \ge 0$ на $I$, причём $f'(x) = 0$ лишь в отдельных точках (точнее — множество нулей не содержит ни одного целого интервала), то $f$ строго возрастает на $I$.
Аналогично: $f'(x) \le 0$ с нулями лишь в отдельных точках даёт строгое убывание.
Почему условие «не содержит интервала» существенно, видно на ReLU: там $f' = 0$ на всей полупрямой $(-\infty;0)$ — целый интервал нулей, — и строгого возрастания нет, функция там просто константа.
Примеры с разбором
Пример 1 (простой). $f(x) = x^3 - 3x^2 + 3x + 7$.
$f'(x) = 3x^2 - 6x + 3 = 3(x^2 - 2x + 1) = 3(x-1)^2 \ge 0$, и равна нулю только при $x = 1$ — одна точка.
Ответ: функция строго возрастает на всей числовой прямой $\mathbb{R}$. Точка $x=1$ — критическая, но смены знака в ней нет, поэтому монотонность не прерывается. (Является ли она экстремумом — вопрос урока 141; забегая вперёд: не является.)
Пример 2 (средний). $f(x) = x - \sin x$.
$f'(x) = 1 - \cos x$. Косинус не превосходит единицы, поэтому $f' \ge 0$ всегда. Нули: $\cos x = 1 \Leftrightarrow x = 2\pi n$, $n \in \mathbb{Z}$ — это отдельные, изолированные точки, интервала они не образуют.
Ответ: $f(x) = x - \sin x$ строго возрастает на $\mathbb{R}$. Проверка: $f(0) = 0$, $f(2\pi) = 2\pi \approx 6{,}28$, $f(4\pi) \approx 12{,}57$ — растёт, несмотря на бесконечное число точек с нулевой производной. Кстати, отсюда сразу следует неравенство $\sin x < x$ при $x > 0$.
Пример 3 (сложный). Сравним два похожих на вид случая.
Функция $u(x) = x^5$: $u'(x) = 5x^4 \ge 0$, ноль только при $x=0$ → строго возрастает на $\mathbb{R}$.
Функция $v(x) = \max(x,0)$ (ReLU): $v'(x) = 0$ при $x<0$ и $v'(x) = 1$ при $x>0$ (в нуле производной нет). Нули производной заполняют целый интервал → строгого возрастания нет, только нестрогое.
Разница в одном: у $u$ множество нулей производной — это $\{0\}$, у $v$ — это луч. Первое допустимо, второе нет.
Ответ: $x^5$ строго возрастает на $\mathbb{R}$; ReLU лишь неубывающая. Формальный критерий различения: содержит ли множество нулей производной хотя бы один интервал.
Почему это важно
Практическая польза усиленной формулировки огромна: она позволяет не разбивать ответ на куски там, где разбивать не нужно. Для $f(x) = (x-1)^3$ ответ «возрастает на $(-\infty;1]$ и на $[1;+\infty)$» формально не ошибочен, но неуклюж — правильный ответ короче: «возрастает на $\mathbb{R}$».
Второе — доказательства неравенств. Схема «показать, что $g' \ge 0$, и сослаться на возрастание» работает даже когда производная касается нуля. Именно так доказывают $e^x \ge 1+x$, $\sin x < x$ при $x>0$, $\ln(1+x) \le x$ — три неравенства, на которых стоит половина оценок в теории вероятностей и в анализе алгоритмов ML.
Алгоритм поиска промежутков монотонности
Собираем всё в процедуру. Она надстраивает таблицу знаков из урока 139 одним финальным шагом — переводом знаков в слова «возрастает / убывает».
Алгоритм:
- Найти область определения $D(f)$. Всё исследование живёт только внутри неё.
- Найти $f'(x)$ и по возможности разложить на множители.
- Найти точки, где $f'(x) = 0$, и точки области определения, где $f'$ не существует. Это критические точки.
- Отметить на числовой прямой критические точки и границы/разрывы области определения. Они режут $D(f)$ на промежутки.
- На каждом промежутке определить знак $f'$ — пробной точкой или по множителям.
- Записать ответ словами, аккуратно оформив концы промежутков.
Шаг 1 не декоративный: пропуск области определения — ошибка номер один в этой теме. Шаг 4 — вторая по частоте: разрывы не являются критическими точками, но промежутки режут точно так же.
Пример 1 (простой): многочлен
$f(x) = 3x^4 - 4x^3 - 12x^2 + 5$.
Шаг 1. Многочлен, $D(f) = \mathbb{R}$.
Шаг 2. $f'(x) = 12x^3 - 12x^2 - 24x = 12x(x^2 - x - 2) = 12x(x-2)(x+1)$.
Шаг 3. Критические точки: $x = -1$, $x = 0$, $x = 2$. Точек, где производная не существует, нет.
Шаг 4. Четыре промежутка: $(-\infty;-1)$, $(-1;0)$, $(0;2)$, $(2;+\infty)$.
Шаг 5. Знаки произведения $12x(x-2)(x+1)$:
- $x = -2$: $12\cdot(-2)\cdot(-4)\cdot(-1) = -96 < 0$;
- $x = -0{,}5$: $12\cdot(-0{,}5)\cdot(-2{,}5)\cdot(0{,}5) = 7{,}5 > 0$;
- $x = 1$: $12\cdot 1\cdot(-1)\cdot 2 = -24 < 0$;
- $x = 3$: $12\cdot 3\cdot 1\cdot 4 = 144 > 0$.
| $x$ | $(-\infty;-1)$ | $-1$ | $(-1;0)$ | $0$ | $(0;2)$ | $2$ | $(2;+\infty)$ |
|---|---|---|---|---|---|---|---|
| $f'(x)$ | $-$ | $0$ | $+$ | $0$ | $-$ | $0$ | $+$ |
| $f(x)$ | ↘ | ↗ | ↘ | ↗ |
Ответ: убывает на $(-\infty;-1]$ и на $[0;2]$, возрастает на $[-1;0]$ и на $[2;+\infty)$.
Пример 2 (средний): дробно-рациональная функция
$f(x) = \dfrac{x^2-3}{x-2}$.
Шаг 1. $D(f) = (-\infty;2)\cup(2;+\infty)$.
Шаг 2. Производная частного:
$$f'(x) = \frac{2x(x-2) - (x^2-3)\cdot 1}{(x-2)^2} = \frac{2x^2 - 4x - x^2 + 3}{(x-2)^2} = \frac{x^2-4x+3}{(x-2)^2} = \frac{(x-1)(x-3)}{(x-2)^2}.$$Шаг 3. Нули: $x = 1$ и $x = 3$. Точка $x=2$ из области определения выпала, критической не считается.
Шаг 4. Промежутки: $(-\infty;1)$, $(1;2)$, $(2;3)$, $(3;+\infty)$ — четыре штуки, потому что разрыв в $x=2$ тоже режет.
Шаг 5. Знаменатель положителен, знак задаёт $(x-1)(x-3)$: плюс при $x<1$, минус на $(1;3)$, плюс при $x>3$.
| $x$ | $(-\infty;1)$ | $1$ | $(1;2)$ | $2$ | $(2;3)$ | $3$ | $(3;+\infty)$ |
|---|---|---|---|---|---|---|---|
| $f'(x)$ | $+$ | $0$ | $-$ | не сущ. | $-$ | $0$ | $+$ |
| $f(x)$ | ↗ | ↘ | разрыв | ↘ | ↗ |
Проверка числами: $f(0) = \frac{-3}{-2} = 1{,}5$, $f(1) = \frac{-2}{-1} = 2$ (росло ✅), $f(1{,}5) = \frac{-0{,}75}{-0{,}5} = 1{,}5$ (упало ✅), $f(2{,}5) = \frac{3{,}25}{0{,}5} = 6{,}5$, $f(3) = \frac{6}{1} = 6$ (упало ✅), $f(4) = \frac{13}{2} = 6{,}5$ (выросло ✅).
Ответ: возрастает на $(-\infty;1]$ и на $[3;+\infty)$, убывает на $[1;2)$ и на $(2;3]$.
Пример 3 (сложный): логарифм и экспонента
$f(x) = x^2\ln x$.
Шаг 1. Логарифм требует $x>0$, значит $D(f) = (0;+\infty)$. Это главный шаг: половина неверных ответов в таких задачах — от попытки исследовать функцию на всей прямой.
Шаг 2. Правило произведения плюс табличная производная логарифма (уроки 136, 138):
$$f'(x) = 2x\ln x + x^2\cdot\frac1x = 2x\ln x + x = x(2\ln x + 1).$$Шаг 3. В области определения $x>0$, поэтому множитель $x$ положителен и на знак не влияет. Остаётся $2\ln x + 1 = 0 \Leftrightarrow \ln x = -\dfrac12 \Leftrightarrow x = e^{-1/2} = \dfrac{1}{\sqrt e}\approx 0{,}6065$.
Шаг 4. Два промежутка: $\left(0;\,e^{-1/2}\right)$ и $\left(e^{-1/2};+\infty\right)$.
Шаг 5. Логарифм возрастает, поэтому при $x < e^{-1/2}$ выражение $2\ln x + 1$ отрицательно, при $x > e^{-1/2}$ — положительно. Проверим: $x = 0{,}1$ → $2\ln 0{,}1 + 1 = -4{,}605 + 1 = -3{,}605 < 0$; $x = 1$ → $2\cdot 0 + 1 = 1 > 0$ ✅
Ответ: убывает на $\left(0;\,e^{-1/2}\right]$, возрастает на $\left[e^{-1/2};+\infty\right)$. Наименьшее значение $f(e^{-1/2}) = e^{-1}\cdot\left(-\frac12\right) = -\dfrac{1}{2e}\approx -0{,}1839$.
Почему это важно
Алгоритм одинаков для любой функции — меняется только техника взятия производной и решения неравенства. Именно поэтому в уроке 138 столько внимания уделялось таблице: без неё шаг 2 упирается в стену.
Отдельно стоит запомнить приём из третьего примера: множители постоянного знака вычёркиваются. Экспонента $e^{kx}$, квадрат $(x-a)^2$ (при анализе строгого знака), сумма $x^2+1$, положительная константа — всё это не влияет на знак и только загромождает анализ. Отбросив их, ты часто сводишь сложное выражение к произведению двух-трёх скобок, знаки которых читаются мгновенно.
Как правильно оформить ответ
Этот раздел — про то, где теряют баллы даже те, кто всё посчитал верно.
Ошибка со знаком объединения
Правило: промежутки монотонности перечисляют через запятую или через союз «и», но не объединяют знаком $\cup$.
Причина простая: монотонность на каждом из двух множеств не влечёт монотонность на их объединении. Возьмём $f(x) = \dfrac1x$. Она убывает на $(-\infty;0)$ и убывает на $(0;+\infty)$. Запишем «убывает на $(-\infty;0)\cup(0;+\infty)$» — и проверим это по определению.
Определение требует: для любых $x_1 < x_2$ из множества выполняется $f(x_1) > f(x_2)$. Берём $x_1 = -1$, $x_2 = 1$ — обе точки принадлежат объединению. Считаем: $f(-1) = -1$, $f(1) = 1$. Получилось $f(x_1) = -1 < 1 = f(x_2)$ — вместо убывания вышло возрастание. Утверждение ложно.
Правильная запись: «функция убывает на $(-\infty;0)$ и на $(0;+\infty)$».
Тот же эффект даёт любой разрыв. Для $f(x) = \frac{x+1}{x-1}$ производная $f'(x) = \frac{-2}{(x-1)^2} < 0$ всюду, но $f(0) = -1$, а $f(2) = 3$: при переходе через разрыв всё переворачивается.
Заметь тонкость: для множества значений производной или для решения неравенства $f'(x)>0$ знак $\cup$ совершенно уместен — там речь о множестве точек, а не о свойстве, привязанном к связному промежутку. Различие в том, что «$f'>0$ на множестве» — это поточечное свойство, а «$f$ возрастает на множестве» — свойство пар точек.
Открытые или закрытые скобки
Второй вопрос, который вызывает споры: писать $(-\infty;2)$ или $(-\infty;2]$?
Правило: если функция непрерывна в концевой точке и монотонна на открытом промежутке, конец можно включить — монотонность сохранится.
Это прямое следствие условий теоремы: непрерывность требуется на отрезке, дифференцируемость — только внутри. Разберём три типичных случая.
Случай 1: критическая точка внутри области определения. $f(x) = x^2-6x+5$ убывает на $(-\infty;3)$ и возрастает на $(3;+\infty)$. Можно ли писать $(-\infty;3]$? Да. Возьмём $x_1 < x_2 \le 3$: если $x_2 < 3$, всё следует из теоремы; если $x_2 = 3$, то $f(x_1) > f(3)$, потому что $f(x_1) - f(3) = (x_1-3)^2 > 0$. Обе записи считаются верными, но с закрытыми скобками ответ «плотнее»: промежутки стыкуются без дырок.
Случай 2: точка разрыва. $f(x) = \frac1x$: точку $0$ включить нельзя ни в какую сторону — функция там не определена. Скобка обязана быть открытой.
Случай 3: конец области определения, где производной нет. $f(x) = \sqrt{x^2-9}$. Область: $|x|\ge 3$. Производная $f'(x) = \frac{x}{\sqrt{x^2-9}}$ в точках $\pm 3$ не существует (знаменатель обращается в ноль, касательная вертикальна). Но функция в этих точках непрерывна: $f(3) = 0$. Теорема применима на отрезке $[3;b]$ при любом $b>3$, поэтому ответ пишут с закрытой скобкой: возрастает на $[3;+\infty)$, убывает на $(-\infty;-3]$.
Пример разбора: три ответа подряд
Пример 1 (простой). $f(x) = x^3 - 3x$. Производная $3(x-1)(x+1)$.
Ответ: возрастает на $(-\infty;-1]$ и на $[1;+\infty)$, убывает на $[-1;1]$.
Разбор оформления: скобки закрытые (функция непрерывна везде), объединения нет, промежутки перечислены через «и».
Пример 2 (средний). $f(x) = \dfrac{2x+1}{x-3}$. Производная $\dfrac{-7}{(x-3)^2} < 0$.
Ответ: убывает на $(-\infty;3)$ и на $(3;+\infty)$.
Разбор: скобки у тройки открытые (разрыв), запись раздельная. Контроль: $f(0) = -\frac13 \approx -0{,}33$, $f(4) = 9$ — при $0<4$ значение выросло, что подтверждает недопустимость объединения.
Пример 3 (сложный). $f(x) = \sqrt{x} - x$ на $D(f) = [0;+\infty)$.
$f'(x) = \dfrac{1}{2\sqrt x} - 1 = \dfrac{1 - 2\sqrt x}{2\sqrt x}$ при $x>0$; в нуле производной нет (вертикальная касательная).
Нуль производной: $2\sqrt x = 1 \Rightarrow \sqrt x = \frac12 \Rightarrow x = \frac14$.
Знаки: при $0
Ответ: возрастает на $\left[0;\frac14\right]$, убывает на $\left[\frac14;+\infty\right)$. Ноль включён, потому что функция там непрерывна, хотя производной нет. Наибольшее значение $f\left(\frac14\right) = \frac12 - \frac14 = \frac14$.
Почему это важно
Оформление здесь — не про аккуратность, а про смысл. Запись «убывает на $(-\infty;0)\cup(0;+\infty)$» утверждает ложное математическое высказывание, и проверить это можно за пять секунд подстановкой двух чисел. В прикладной задаче цена такой ошибки реальна: если ты сообщаешь, что метрика монотонно растёт по гиперпараметру на объединении двух диапазонов, кто-то может сделать вывод «берём максимальное значение из правого диапазона» — и получить не то, что ожидал.
Полезная привычка: закончив задачу, подставь по одному числу из каждого промежутка и сравни значения. Тридцать секунд — и ответ либо подтверждён, либо развалился.
Зачем нужна монотонность сама по себе
Монотонность — это не только пункт в схеме исследования функции. Это свойство, из которого напрямую вытекают три очень полезные вещи.
1. Монотонная функция обратима
Теорема: Если функция строго монотонна на промежутке $I$, то она принимает каждое своё значение ровно один раз, а значит имеет обратную функцию на множестве своих значений.
Доказательство помещается в строку: пусть $x_1 \ne x_2$; тогда либо $x_1 < x_2$, либо $x_2 < x_1$, и в обоих случаях строгая монотонность даёт $f(x_1) \ne f(x_2)$. Разным аргументам — разные значения, то есть функция инъективна.
Отсюда все обратные функции, которые ты знаешь: $\ln$ существует потому, что $e^x$ строго возрастает; $\arcsin$ существует потому, что синус строго возрастает на $\left[-\frac\pi2;\frac\pi2\right]$ — и именно поэтому его пришлось «обрезать» до этого отрезка, на всей прямой синус не монотонен и обратной функции не имеет.
2. Единственность корня уравнения
Если функция строго монотонна на промежутке, уравнение $f(x) = c$ имеет на нём не более одного корня. А если функция ещё и непрерывна и меняет знак на концах, то ровно один (теорема о промежуточном значении, урок 132).
Пример 1 (простой). Сколько корней у уравнения $x^3 + x = 5$?
Рассмотрим $f(x) = x^3 + x - 5$. Производная $f'(x) = 3x^2 + 1 > 0$ всюду → функция строго возрастает на $\mathbb{R}$ → корней не больше одного. Считаем значения: $f(1) = 1+1-5 = -3 < 0$, $f(2) = 8+2-5 = 5 > 0$. Знак меняется, функция непрерывна.
Ответ: ровно один корень, он лежит в $(1;2)$. Численно $x \approx 1{,}5159$.
Это не учебная экзотика: ровно так работает бинарный поиск корня в численных методах. Он корректен только для монотонной функции — иначе интервал можно сузить не на тот корень.
3. Монотонное преобразование не сдвигает точку максимума
Вот самый ценный для ML факт.
Утверждение: Если $\varphi$ строго возрастает, то $\arg\max_x \varphi(g(x)) = \arg\max_x g(x)$ — точка максимума не меняется (само значение максимума, разумеется, меняется).
Почему: точка $x_0$ — максимум $g$ означает $g(x) \le g(x_0)$ для всех $x$. Применим возрастающую $\varphi$ к обеим частям: неравенство сохранится, $\varphi(g(x)) \le \varphi(g(x_0))$. Значит $x_0$ — максимум и для $\varphi\circ g$. В обратную сторону — точно так же, через обратную функцию $\varphi^{-1}$, которая существует по пункту 1.
Пример 2 (средний). Найдём, при каком $p\in(0;1)$ максимальна функция правдоподобия $L(p) = p^4(1-p)^6$ (это вероятность увидеть 4 успеха и 6 неудач в 10 испытаниях при вероятности успеха $p$).
Дифференцировать произведение степеней неприятно. Логарифм строго возрастает, поэтому точка максимума не изменится, если перейти к $\ell(p) = \ln L(p) = 4\ln p + 6\ln(1-p)$:
$$\ell'(p) = \frac{4}{p} - \frac{6}{1-p} = \frac{4(1-p) - 6p}{p(1-p)} = \frac{4 - 10p}{p(1-p)}.$$Знаменатель на $(0;1)$ положителен, знак задаёт числитель: $\ell' > 0$ при $p < 0{,}4$ и $\ell' < 0$ при $p > 0{,}4$.
Ответ: $\ell$ возрастает на $(0;0{,}4]$, убывает на $[0{,}4;1)$, максимум достигается при $p = 0{,}4$ — ровно доля успехов в выборке. Проверка численным перебором с шагом $10^{-4}$ подтверждает: максимум в $p = 0{,}4$ ✅
Пример 3 (сложный). Проверим, что «максимум» здесь не совпадает случайно. Возьмём $g(x) = -x^2 + 4x$ (максимум в $x=2$, значение $4$) и монотонное преобразование $\varphi(t) = e^{t}$. Тогда $h(x) = e^{-x^2+4x}$, и
$$h'(x) = e^{-x^2+4x}\cdot(-2x+4).$$Экспонента положительна всегда, знак задаёт $-2x+4$: плюс при $x<2$, минус при $x>2$.
Ответ: $h$ возрастает на $(-\infty;2]$, убывает на $[2;+\infty)$ — та же точка $x=2$, что и у $g$, хотя значения совсем другие ($h(2) = e^4 \approx 54{,}6$ против $g(2)=4$). Точка максимума сохранилась, масштаб — нет.
Почему это важно
Три перечисленных следствия — это, по сути, три инструмента. Обратимость даёт право говорить об обратных функциях и о корректности замены переменной. Единственность корня превращает «решить уравнение» в «найти интервал знакоперемены и сузить его» — фундамент численных методов. А инвариантность точки максимума при монотонном преобразовании — это разрешение работать с логарифмом правдоподобия вместо самого правдоподобия, чем занимается практически вся статистика и весь ML.
ML-контекст: где монотонность решает
1. Все стандартные активации неубывающие
Это не совпадение, а осознанный выбор.
- Сигмоида $\sigma(z) = \dfrac{1}{1+e^{-z}}$: производная $\sigma'(z) = \sigma(z)(1-\sigma(z))$. Оба множителя лежат в $(0;1)$, значит $\sigma' > 0$ всюду — строгое возрастание на $\mathbb{R}$. Максимум производной в нуле: $0{,}5\cdot 0{,}5 = 0{,}25$.
- Гиперболический тангенс $\tanh z$: производная $1 - \tanh^2 z \in (0;1]$ — тоже строго возрастает, максимум производной $1$ в нуле.
- ReLU $\max(z,0)$: неубывающая, строго возрастает только при $z>0$.
- Softplus $\ln(1+e^z)$: производная равна ровно $\sigma(z) > 0$ — строго возрастает, и это гладкая версия ReLU.
- GELU и Swish — почти монотонные, с крошечным немонотонным провалом в районе $z\approx -1$; это как раз считается их особенностью, а не свойством по умолчанию.
Зачем монотонность активации? Она гарантирует, что увеличение предактивации не может уменьшить выход нейрона. Это делает поведение сети предсказуемым, а главное — производная не меняет знак, и градиент, идущий через слой по цепному правилу (урок 137), не переворачивается непредсказуемым образом. Немонотонная активация превратила бы ландшафт лосса в кашу из лишних локальных экстремумов.
2. Log-likelihood вместо likelihood
Функция правдоподобия для выборки из $n$ независимых наблюдений — это произведение:
$$L(\theta) = \prod_{i=1}^{n} p(x_i\mid\theta).$$Работать с ней невозможно по двум причинам. Первая — арифметическая: при $n = 1000$ и типичных вероятностях порядка $0{,}1$ произведение равно примерно $10^{-1000}$, что в float64 просто ноль (машинный ноль наступает около $10^{-308}$). Вторая — вычислительная: производная произведения тысячи множителей по правилу произведения даёт тысячу слагаемых.
Логарифм лечит обе проблемы:
$$\ell(\theta) = \ln L(\theta) = \sum_{i=1}^{n}\ln p(x_i\mid\theta).$$Произведение стало суммой, числа стали адекватными (вместо $10^{-1000}$ — примерно $-2300$). А право так делать даёт ровно монотонность: $\ln$ строго возрастает на $(0;+\infty)$, значит $\arg\max \ell = \arg\max L$. Точка максимума та же самая — меняется только значение.
Отсюда же и cross-entropy loss: минимизация $-\ell(\theta)$ и есть максимизация правдоподобия. Каждый раз, когда ты пишешь nn.CrossEntropyLoss(), ты пользуешься тем, что логарифм монотонен.
3. Изотоническая регрессия и калибровка вероятностей
Задача калибровки звучит так. Модель выдаёт «вероятность» $0{,}8$. Но действительно ли среди объектов с таким скором положительных примерно 80%? У градиентного бустинга — обычно нет: он даёт хорошее ранжирование, но плохо откалиброванные числа.
Чинят это так: строят функцию $g$, которая переводит сырой скор в честную вероятность. Требование к $g$ — монотонность: если модель дала объекту больший скор, откалиброванная вероятность не должна оказаться меньше. Иначе калибровка испортила бы ранжирование, а вместе с ним и ROC-AUC.
Изотоническая регрессия — это и есть задача «найти неубывающую функцию, ближайшую к данным по методу наименьших квадратов»:
$$\min_{\hat y_1 \le \hat y_2 \le \dots \le \hat y_n}\ \sum_{i=1}^n (y_i - \hat y_i)^2.$$Решается алгоритмом PAVA за $O(n)$: идём слева направо, и как только видим пару соседей с нарушением порядка ($\hat y_i > \hat y_{i+1}$), сливаем их в один блок и заменяем средним. Отсюда и название — pool adjacent violators, «объединяй соседей-нарушителей». В результате получается ступенчатая неубывающая функция — та самая нестрогая монотонность из первого раздела, с горизонтальными участками.
Альтернатива — Platt scaling: подгонка сигмоиды $\sigma(az+b)$ при $a>0$. Она автоматически монотонна, потому что сигмоида строго возрастает, а $az+b$ при $a>0$ тоже. Композиция двух возрастающих функций возрастает — тот же приём, что в задании 27 ниже.
4. Monotonic constraints в градиентном бустинге
Вернёмся к сюжету из вступления. LightGBM, XGBoost и CatBoost умеют принимать параметр вида monotone_constraints=[1, 0, -1, ...]: для каждого признака указывается $+1$ (выход обязан не убывать по этому признаку), $-1$ (не возрастать) или $0$ (без ограничения). Реализуется это на уровне построения дерева: при выборе сплита проверяется, не нарушит ли он заданный порядок значений в листьях; нарушающие сплиты отбрасываются.
Зачем это нужно, если ограничение почти всегда чуть-чуть ухудшает метрику на обучении:
- Регуляторные требования. В кредитном скоринге модель должна объясняться клиенту и проверяться регулятором. «Ваш доход вырос, а лимит упал» — неприемлемое объяснение, даже если оно статистически обосновано на трёх наблюдениях.
- Защита от переобучения на шуме. Немонотонный изгиб на хвосте распределения признака почти всегда означает, что там было 5 наблюдений. Ограничение убирает этот изгиб по построению.
- Доверие бизнеса. Модель, которая согласуется со здравым смыслом («больше площадь → дороже квартира», «больше просрочек → выше риск»), внедряется, а немонотонная — застревает на согласовании.
- Устойчивость к сдвигу распределения. Монотонная зависимость экстраполируется предсказуемо: за пределами обучающей выборки она хотя бы не развернётся в обратную сторону.
Цена вопроса обычно невелика: на табличных задачах монотонные ограничения по 3–5 ключевым признакам стоят десятые доли процента AUC, а иногда даже улучшают метрику на тесте за счёт снижения переобучения.
5. Монотонность лосса по параметру
Ещё один сюжет — диагностика обучения. Если ты фиксируешь все параметры кроме одного и смотришь на лосс как на функцию этого параметра, монотонный участок означает: «двигайся дальше в ту же сторону, оптимум ещё не пройден». Смена характера монотонности — сигнал, что оптимум рядом.
На этом построен подбор learning rate методом LR range test: скорость обучения плавно увеличивают и смотрят на кривую лосса. Пока лосс монотонно падает — увеличиваем; как только начал расти — прошли оптимальную зону. Практическая рекомендация «бери значение в 3–10 раз меньше точки разворота» — это ровно эвристика про промежуток монотонности.
Почему это важно
Монотонность в ML — редкий пример свойства, которое одинаково важно и математику, и инженеру, и юристу. Математику она даёт обратимость и единственность корня. Инженеру — право заменить произведение на сумму логарифмов и не поймать underflow. Юристу и риск-менеджеру — гарантию, что модель не выдаст абсурдное решение на клиенте, которого не было в обучающей выборке. И всё это — из одного школьного определения про пару точек $x_1 < x_2$.
Практика: 30 заданий
Базовые (задания 1-10)
Задание 1: Докажи по определению, что функция $f(x) = 3x - 7$ возрастает на $\mathbb{R}$ (без производной).
Задание 2: Найди промежутки монотонности функции $f(x) = x^2 - 6x + 5$.
Задание 3: Найди промежутки монотонности функции $f(x) = -2x^2 + 8x - 1$.
Задание 4: Найди промежутки монотонности функции $f(x) = x^3 - 3x^2 - 9x + 5$.
Задание 5: Исследуй на монотонность $f(x) = x^3 + 6x^2 + 12x + 1$.
Задание 6: Найди промежутки монотонности функции $f(x) = x^4 - 8x^2 + 3$.
Задание 7: Исследуй на монотонность $f(x) = \dfrac{1}{x-2}$ и правильно оформи ответ.
Задание 8: Найди промежутки монотонности функции $f(x) = \dfrac{2x+1}{x-3}$.
Задание 9: Найди промежутки монотонности функции $f(x) = x + \dfrac{4}{x}$.
Задание 10: Найди промежутки монотонности функции $f(x) = \dfrac{x}{x^2+1}$.
Средние (задания 11-20)
Задание 11: Найди промежутки монотонности функции $f(x) = \ln(x^2 - 4x + 5)$.
Задание 12: Найди промежутки монотонности функции $f(x) = x - \ln x$.
Задание 13: Найди промежутки монотонности функции $f(x) = x e^{-x}$.
Задание 14: Найди промежутки монотонности функции $f(x) = \sqrt{x^2-9}$. Особое внимание удели скобкам в ответе.
Задание 15: Найди промежутки монотонности функции $f(x) = \sqrt{x} - x$ и её наибольшее значение.
Задание 16: Найди промежутки монотонности функции $f(x) = \dfrac{\ln x}{x}$.
Задание 17: Докажи, что функция $f(x) = 2x + \sin x$ строго возрастает на всей числовой прямой.
Задание 18: Докажи, что функция $f(x) = x^5 + 3x^3 + 7x - 2$ строго возрастает на $\mathbb{R}$, и объясни, что отсюда следует про уравнение $f(x)=0$.
Задание 19: Сколько корней имеет уравнение $x^3 + 3x = 10$?
Задание 20: Кривая обучения модели описывается функцией $L(t) = 3e^{-0{,}5t} + 0{,}2t$, где $t \ge 0$ — номер эпохи. На каких промежутках лосс падает, а на каких растёт? В какой момент надо включать early stopping?
Продвинутые (задания 21-30)
Задание 21: Сколько корней имеет уравнение $x^3 - 3x = 1$?
Задание 22: При каких значениях параметра $a$ функция $f(x) = x^3 + ax^2 + 3x + 1$ возрастает на всей числовой прямой?
Задание 23: При каких значениях параметра $a$ функция $f(x) = ax^3 - 3x^2 + 12x - 5$ возрастает на всей числовой прямой?
Задание 24: При каких значениях параметра $a$ функция $f(x) = x^3 - 3ax^2 + 5$ убывает на промежутке $(1;3)$?
Задание 25: При каких значениях параметра $a$ функция $f(x) = \ln x + ax$ убывает на промежутке $(1;+\infty)$?
Задание 26: Студент исследовал функцию $f(x) = \dfrac{x+1}{x-1}$ и записал ответ: «убывает на $(-\infty;1)\cup(1;+\infty)$». Найди ошибку, приведи конкретный контрпример и запиши правильный ответ.
Задание 27: Функция $g$ строго возрастает на $\mathbb{R}$, функция $f$ строго убывает на $\mathbb{R}$. Что можно сказать про монотонность композиции $h(x) = f(g(x))$? Докажи по определению и проверь на примере $h(x) = e^{-x^3}$.
Задание 28: Докажи, что сигмоида $\sigma(z) = \dfrac{1}{1+e^{-z}}$ и softplus $s(z) = \ln(1+e^z)$ строго возрастают на $\mathbb{R}$. Объясни, почему у сигмоиды это не противоречит тому, что её производная стремится к нулю при $z \to \pm\infty$.
Задание 29: Модель кредитного скоринга выдаёт балл $S(x) = 0{,}8x - 0{,}05x^2$, где $x \in [0;10]$ — годовой доход клиента в миллионах рублей. Проверь, монотонна ли модель по доходу. Если нет — найди пару клиентов, на которой видно нарушение, и объясни, что даёт monotonic constraint.
Задание 30: В 10 испытаниях получено 7 успехов и 3 неудачи. Функция правдоподобия $L(p) = p^7(1-p)^3$ на $(0;1)$. Найди точку максимума, перейдя к логарифму, и объясни, почему такой переход законен.
Частые ошибки
❌ Ошибка 1: объединять промежутки монотонности знаком $\cup$
Неправильно: «функция $f(x) = \frac1x$ убывает на $(-\infty;0)\cup(0;+\infty)$».
Правильно: «функция $f(x) = \frac1x$ убывает на $(-\infty;0)$ и на $(0;+\infty)$».
💡 Почему важно: это не стилистика, а ложное утверждение. Проверяется двумя числами: $-1 < 1$, но $f(-1) = -1 < 1 = f(1)$ — вместо убывания получилось возрастание. Определение монотонности работает с парами точек, а пара может оказаться «по разные стороны» дыры. Тот же эффект в ML: если сообщить, что метрика монотонно растёт по гиперпараметру на объединении двух диапазонов, кто-то сделает вывод «берём максимум из правого» — и промахнётся.
❌ Ошибка 2: игнорировать область определения
Неправильно: для $f(x) = x - \ln x$ найти $f' = 1 - \frac1x$, нуль при $x=1$, и записать «убывает на $(-\infty;1)$, возрастает на $(1;+\infty)$».
Правильно: $D(f) = (0;+\infty)$, поэтому «убывает на $(0;1]$, возрастает на $[1;+\infty)$».
💡 Почему важно: половина отрицательной полуоси в первом ответе просто не существует — там нет ни функции, ни производной. Область определения — шаг номер один алгоритма, и пропуск этого шага портит ответ независимо от того, насколько верно взята производная. Логарифм, корень чётной степени и дробь — три главных источника ограничений.
❌ Ошибка 3: считать, что $f'(x_0) > 0$ означает возрастание около точки $x_0$
Неправильно: «производная в точке положительна, значит рядом функция растёт».
Правильно: признак монотонности требует положительности производной на всём промежутке. Функция $g(x) = x + 2x^2\sin\frac1x$ (с $g(0)=0$) имеет $g'(0) = 1 > 0$, но не возрастает ни на каком промежутке вокруг нуля: в точках $x_n = \frac{1}{2\pi n}$ её производная равна $-1$.
💡 Почему важно: это самая распространённая логическая подмена в теме — «свойство точки» подменяется «свойством окрестности». Теорема Лагранжа, из которой признак выводится, работает именно с отрезком: неизвестная точка $c$ может оказаться где угодно между $x_1$ и $x_2$, поэтому нужна гарантия для всех точек сразу.
❌ Ошибка 4: считать, что строгое возрастание требует $f' > 0$ везде
Неправильно: «раз $f'(0) = 0$ у функции $y = x^3$, то на $\mathbb{R}$ она не возрастает — надо писать два промежутка».
Правильно: $y = x^3$ строго возрастает на всей числовой прямой. Нули производной в отдельных точках возрастанию не мешают; мешал бы только целый интервал нулей.
💡 Почему важно: признак «$f'>0$» достаточный, но не необходимый. Из-за путаницы здесь ответы дробят на лишние куски: для $f(x)=(x-1)^3$ пишут «возрастает на $(-\infty;1]$ и на $[1;+\infty)$» вместо короткого «возрастает на $\mathbb{R}$». Граница разумного: множество нулей производной не должно содержать интервала (сравни с ReLU, где $f'=0$ на целом луче и строгого возрастания нет).
❌ Ошибка 5: не разбивать прямую в точках разрыва, потому что «они не критические»
Неправильно: для $f(x) = \frac{x^2}{x-1}$ найти нули производной $x=0$, $x=2$ и записать три промежутка: $(-\infty;0]$, $[0;2]$, $[2;+\infty)$.
Правильно: точка $x=1$ — разрыв, она тоже режет прямую. Промежутков четыре: возрастает на $(-\infty;0]$, убывает на $[0;1)$ и на $(1;2]$, возрастает на $[2;+\infty)$.
💡 Почему важно: критические точки и точки разбиения — разные списки. Критические точки лежат внутри области определения; точки разрыва в неё вообще не входят, но границы промежутков задают. Проверить легко: подставить по числу слева и справа от подозрительной точки — для $f(0{,}5) = -0{,}5$ и $f(1{,}5) = 4{,}5$ сразу видно, что «протянуть» вывод через единицу нельзя.
❌ Ошибка 6: путать знак функции и знак производной
Неправильно: «$f(x) = x - 10$ отрицательна на $(0;5)$, значит там она убывает».
Правильно: монотонность определяется знаком $f'$, а не знаком $f$. Здесь $f'(x) = 1 > 0$ — функция возрастает на всей прямой, оставаясь при этом отрицательной на $(0;5)$: $f(0) = -10 < f(5) = -5$.
💡 Почему важно: «функция растёт» и «функция большая» — независимые свойства. В ML это ровно разница между значением лосса и его градиентом: лосс может быть большим и при этом быстро падать (хорошо), а может быть маленьким и медленно расти (переобучение началось). Смотреть надо на производную.
❌ Ошибка 7: терять множители постоянного знака или, наоборот, учитывать их в знаках
Неправильно: для $f'(x) = e^{-x}x(2-x)$ строить таблицу знаков по трём множителям, включая экспоненту, и путаться.
Правильно: $e^{-x} > 0$ при любом $x$, поэтому на знак производной он не влияет — вычёркиваем и анализируем только $x(2-x)$.
💡 Почему важно: множители постоянного знака ($e^{kx}$, $x^2+1$, положительные константы, квадраты в знаменателе) только загромождают анализ. Отбросив их, ты сводишь задачу к произведению двух-трёх линейных скобок. Обратная сторона: вычёркивать можно только то, что строго сохраняет знак. Множитель $(x-a)^2$ в числителе неотрицателен, но обращается в ноль — точку $x=a$ в список критических внести всё равно нужно.
❌ Ошибка 8: неправильно ставить скобки на концах
Неправильно: для $f(x) = \sqrt{x^2-9}$ написать «возрастает на $(3;+\infty)$», аргументируя тем, что в точке $3$ производной не существует.
Правильно: «возрастает на $[3;+\infty)$». Теорема требует непрерывности на отрезке и дифференцируемости только внутри него; функция в точке $3$ непрерывна, значит конец включается.
💡 Почему важно: асимметрия условий теоремы (непрерывность на $[a;b]$, дифференцируемость на $(a;b)$) существует именно ради таких случаев. То же самое с $\sqrt{x}$ в нуле и с $\sqrt[3]{x}$ — вертикальная касательная не мешает монотонности. А вот в точке разрыва скобка обязана быть открытой, и это уже не вопрос вкуса.
Главное запомнить
✅ Определение возрастания: $f$ возрастает на $I$, если для любых $x_1, x_2 \in I$ из $x_1 < x_2$ следует $f(x_1) < f(x_2)$. Убывание — то же самое со знаком $>$. Ключевое слово — «любых»: проверить перебором нельзя.
✅ Нестрогие варианты: неубывающая ($\le$) и невозрастающая ($\ge$) допускают горизонтальные участки. ReLU неубывающая, но не возрастающая: $f(-5) = f(-1) = 0$.
✅ Монотонность — свойство промежутка, не точки. Фраза «возрастает в точке» либо бессмысленна, либо означает не то, что кажется. Контрпример $g(x) = x+2x^2\sin\frac1x$: $g'(0) = 1 > 0$, но возрастания ни на какой окрестности нуля нет.
✅ Достаточный признак: $f$ непрерывна на $[a;b]$, дифференцируема на $(a;b)$; если $f' > 0$ внутри, то $f$ строго возрастает на $[a;b]$; если $f' < 0$ — строго убывает; если $f' \equiv 0$ — постоянна.
✅ Откуда признак берётся: из теоремы Лагранжа (урок 190) — «средняя скорость на отрезке равна мгновенной в какой-то внутренней точке»: $f(x_2)-f(x_1) = f'(c)(x_2-x_1)$. Точка $c$ неизвестна, поэтому нужна гарантия знака сразу на всём промежутке.
✅ Обратное неверно: $y = x^3$ строго возрастает на $\mathbb{R}$, но $f'(0) = 0$. Из строгого возрастания следует лишь $f' \ge 0$.
✅ Усиленный признак: $f' \ge 0$ с нулями лишь в отдельных точках (не заполняющих интервал) → строгое возрастание. Поэтому $x^3$, $x - \sin x$, $(x+2)^3$ возрастают на всей прямой, а ReLU — только неубывающая.
✅ Алгоритм: область определения → производная и разложение на множители → нули $f'$ и точки, где $f'$ не существует → отметить их и разрывы → знак на каждом промежутке → ответ словами.
✅ Вычёркивай множители постоянного знака: $e^{kx}$, $x^2+1$, $(x-a)^2$ в знаменателе, положительные константы. Остаётся короткое произведение скобок.
✅ Оформление ответа: промежутки перечисляют через запятую или «и», никогда через $\cup$. Контрпример на всю жизнь: $\frac1x$ убывает на каждом из лучей, но $f(-1) = -1 < 1 = f(1)$.
✅ Скобки на концах: можно закрывать, если функция в концевой точке непрерывна — даже когда производной там нет ($\sqrt{x^2-9}$ в $\pm 3$, $\sqrt x$ в нуле). В точке разрыва скобка обязательно открытая.
✅ Три следствия монотонности: строго монотонная функция обратима; уравнение $f(x)=c$ имеет на промежутке монотонности не более одного корня; строго возрастающее преобразование не сдвигает точку максимума ($\arg\max\ln L = \arg\max L$).
✅ Монотонность в ML: все стандартные активации неубывающие; log-likelihood вместо likelihood — прямое следствие монотонности логарифма; изотоническая регрессия и Platt scaling калибруют вероятности монотонными функциями; monotonic constraints в бустинге защищают от абсурдных решений и от переобучения на хвостах.
✅ Точка смены знака производной — кандидат в экстремум. Кандидат, а не ответ: строгий разбор — в уроке 141.
Связь с другими темами курса
Что нужно было знать до этого урока:
- Урок 132, непрерывность функции — теорема о монотонности требует непрерывности на отрезке, а вывод о существовании корня («знак меняется — корень есть») опирается на теорему о промежуточном значении.
- Урок 133, определение производной — оттуда предельное определение, которым мы считали $g'(0)$ у функции-контрпримера, и понимание того, что производной может не существовать.
- Урок 135, физический смысл производной — «средняя скорость на отрезке совпадает с мгновенной в какой-то точке» — это интуиция теоремы Лагранжа, на которой стоит весь признак монотонности.
- Уроки 136–138, техника дифференцирования — правила суммы, произведения и частного, цепное правило и таблица производных. Без них шаг 2 алгоритма не сделать.
- Урок 139, применение производной к исследованию функций — связка «знак $f'$ ↔ поведение», критические точки и таблица знаков. Этот урок надстраивает над ней строгие формулировки и правила оформления.
Что изучить дальше:
- Урок 141, точки экстремума — что происходит в точках смены знака производной: какие из критических точек действительно максимумы и минимумы, а какие «пустышки» вроде $x=0$ у $y=x^3$.
- Урок 142, наибольшее и наименьшее значение — глобальная оптимизация на отрезке: сравнение значений в критических точках и на концах. Промежутки монотонности нужны там как основа.
- Урок 143, выпуклость и точки перегиба — вторая производная и вопрос «как именно функция растёт: с ускорением или с замедлением».
- Урок 144, построение графиков — полная схема, где промежутки монотонности становятся одной из строк общего бланка исследования.
- Урок 190, теорема Лагранжа — доказательство того признака, которым ты пользовался весь этот урок.
- ML-блок — функции активации (329), калибровка вероятностей и изотоническая регрессия, монотонные ограничения в градиентном бустинге, метод максимального правдоподобия.
Где это нужно в жизни:
💻 В программировании: бинарный поиск корректен только для монотонного предиката — именно поэтому в задачах на «бинпоиск по ответу» первым делом доказывают монотонность. Монотонные хеши, сортировки по ключу, инвариант «счётчик только растёт» в распределённых системах (логические часы Лампорта) — всё это та же идея.
🤖 В ML/AI: монотонные активации, log-likelihood вместо likelihood, изотоническая регрессия и Platt scaling для калибровки, monotone_constraints в LightGBM/XGBoost/CatBoost, LR range test для подбора learning rate, early stopping по моменту разворота монотонности валидационного лосса.
📊 В Data Science: проверка гипотезы «зависимость монотонна» через коэффициент Спирмена (он измеряет именно монотонную связь, а не линейную), построение монотонных биннингов в скоринге (WoE-биннинг), анализ дозозависимости.
🔬 В науке: энтропия замкнутой системы не убывает (второе начало термодинамики — утверждение о монотонности), скорость реакции монотонна по температуре в законе Аррениуса, любая калибровочная кривая прибора обязана быть монотонной, иначе показания неоднозначны.
💰 В экономике и финансах: кривая спроса убывает по цене, полезность возрастает по доходу с убывающей отдачей, цена облигации монотонно убывает по доходности — и именно монотонность позволяет численно находить YTM бинарным поиском.
Интересные факты
💡 Определение возрастания моложе, чем производная. Ньютон и Лейбниц свободно оперировали «растущими величинами» с 1660–1670-х годов, а строгое определение через пару точек $x_1 < x_2$ появилось только у Коши в 1820-х — почти через полтора века. До этого «возрастание» было интуицией, взятой из механики: точка движется, ордината увеличивается. Математика часто идёт именно так: сначала уверенно считают, потом разбираются, что же именно посчитали.
💡 Монотонная функция почти всюду дифференцируема. Теорема Лебега (1904) утверждает: если функция монотонна на отрезке, то она имеет производную во всех точках, кроме множества меры нуль. Это удивительно сильное утверждение — от функции не требуется ни непрерывности, ни какой-либо формулы, достаточно одной монотонности. Существует даже монотонная функция, непрерывная на $[0;1]$, растущая от $0$ до $1$ и имеющая производную, равную нулю почти всюду — «лестница Кантора».
💡 PAVA работает за линейное время. Алгоритм изотонической регрессии, придуманный в 1955 году, решает задачу минимизации с $n$ ограничениями-неравенствами за $O(n)$ — быстрее, чем большинство методов выпуклой оптимизации справляются с одним ограничением. Секрет в структуре: нарушения порядка можно чинить локально, объединяя соседей, и каждое объединение уменьшает число блоков на единицу.
💡 Коэффициент Спирмена измеряет монотонность, а не линейность. Для пары $(x, y) = (x, x^3)$ обычная корреляция Пирсона на равномерной сетке отрезка $[-1;1]$ даёт около $0{,}92$, а Спирмена — ровно $1{,}0$, потому что $x^3$ строго возрастает и порядок сохраняется идеально. Эта разница — причина, по которой в анализе данных со скошенными распределениями чаще берут ранговые корреляции.
💡 Немонотонная активация тоже бывает полезной. GELU и Swish, стандарт де-факто в современных трансформерах, имеют небольшой немонотонный провал около $z \approx -1$: функция слегка опускается, прежде чем выйти на ноль. Долгое время считалось, что монотонность активации обязательна, — а оказалось, что этот маленький «карман» отрицательных значений помогает обучению. Правило про монотонность активаций осталось хорошим ориентиром, но перестало быть догмой.
Лайфхаки и полезные трюки
1. Сначала область определения, потом всё остальное
Возьми за правило писать $D(f)$ первой строкой решения, ещё до производной. Это ловит львиную долю ошибок в задачах с логарифмом, корнем и дробью.
Пример: в задаче про $f(x) = x-\ln x$ первая же строка «$D(f) = (0;+\infty)$» автоматически убирает соблазн написать ответ $(-\infty;1)$.
2. Вычёркивай множители постоянного знака
Экспонента, $x^2+1$, положительные константы, квадрат в знаменателе — всё это не влияет на знак производной. Убери их сразу и анализируй короткое произведение.
Пример: $f'(x) = \dfrac{(x-1)(x-3)}{(x-2)^2}$ — знаменатель вычёркиваем, остаётся парабола $(x-1)(x-3)$, знаки которой видны без пробных точек: плюс снаружи корней, минус между ними.
3. Проверяй ответ двумя-тремя числами
Подставь по одному значению из каждого промежутка и сравни. Тридцать секунд работы ловят почти любую ошибку в знаках.
Пример: для $f(x) = x + \frac4x$ ответ «возрастает на $(-\infty;-2]$» проверяется мгновенно: $f(-4) = -5$, $f(-3) \approx -4{,}33$, $f(-2) = -4$ — растёт ✅
4. Для многочлена нечётной степени с положительным старшим коэффициентом: если производная — квадратный трёхчлен с $D\le 0$, функция возрастает всюду
Это готовый шаблон для всех задач с параметром «при каких $a$ функция возрастает на $\mathbb{R}$». Условие сводится к дискриминанту, и решение занимает три строки.
Пример: $f(x) = x^3+ax^2+3x+1$, $f' = 3x^2+2ax+3$, $D = 4a^2-36 \le 0 \Rightarrow a \in [-3;3]$.
5. Знак композиции = произведение знаков
Возрастающая ∘ возрастающая = возрастающая; убывающая ∘ убывающая = возрастающая; смешанная = убывающая. Ставь мысленно $+$ и $-$ и перемножай — это в точности то же, что делает цепное правило со знаками множителей.
Пример: $h(x) = e^{-x^3}$ — это убывающая $e^{-u}$ от возрастающей $u=x^3$, значит $h$ убывает. Считать производную не обязательно.
6. Хочешь доказать неравенство — сделай из него функцию и проверь монотонность
Схема: перенеси всё в одну часть, обозначь разность через $g(x)$, покажи, что $g' \ge 0$, и посмотри значение в удобной точке.
Пример: докажем $e^x \ge x+1$. Берём $g(x) = e^x - x - 1$, $g'(x) = e^x - 1$: убывает на $(-\infty;0]$, возрастает на $[0;+\infty)$, наименьшее значение $g(0) = 0$. Значит $g(x) \ge 0$ всюду ✅
7. Логарифмируй перед дифференцированием, если функция — произведение или степень
Логарифм строго возрастает, поэтому точки максимума и промежутки монотонности не сдвигаются, а произведение превращается в сумму. Работает для любой положительной функции.
Пример: вместо $L(p) = p^7(1-p)^3$ дифференцируем $\ell(p) = 7\ln p + 3\ln(1-p)$ — вместо правила произведения получаем две элементарные дроби.
8. Считаешь число корней — сначала найди промежутки монотонности
На каждом промежутке строгой монотонности корень не более одного. Дальше остаётся посмотреть значения на концах промежутков и посчитать смены знака.
Пример: для $x^3-3x=1$ промежутки $(-\infty;-1]$, $[-1;1]$, $[1;+\infty)$; значения $g(-1)=1>0$, $g(1)=-3<0$; знак меняется на каждом промежутке → ровно три корня.
9. При работе с параметром проверяй границу отдельно
Ответы вида $a \le a_0$ почти всегда требуют отдельной проверки самого $a_0$: там производная обычно обращается в ноль в одной точке, и усиленный признак решает, входит граница в ответ или нет.
Пример: в задаче про $x^3+ax^2+3x+1$ при $a=3$ производная равна $3(x+1)^2$ — ноль в одной точке, возрастание сохраняется, значит $a=3$ входит в ответ.
Монотонность выглядит как самая скучная характеристика функции: всего два слова, «растёт» или «падает». Но именно из этих двух слов вырастают обратные функции, бинарный поиск, метод максимального правдоподобия, калибровка вероятностей и требования регулятора к кредитным моделям. Ты научился отвечать на вопрос «где растёт» строго — через знак производной, с проверкой условий теоремы и корректным оформлением ответа.
Осталось разобраться, что происходит в самих точках разворота. Там, где производная меняет знак, функция достигает вершины холма или дна впадины — и именно эти точки в оптимизации ищут в первую очередь. Об этом — следующий урок. 📈
Понял тему? Закрепи в боте! 🚀
Попрактикуйся на задачах и получи персональные рекомендации от AI
💪 Начать тренировку