Линейные дифференциальные уравнения 🎢
Представь, что ты обучаешь нейросеть с оптимизатором, у которого есть момент — стандартный приём, который «разгоняет» градиентный спуск, придавая обновлениям весов что-то вроде инерции. Ты выставляешь момент побольше, чтобы обучение шло быстрее, — и вдруг график функции потерь вместо того, чтобы плавно сползать к минимуму, начинает раскачиваться: резко падает, проскакивает мимо дна, взлетает обратно, снова падает, всё слабее и слабее, пока наконец не успокаивается. Знакомая картина? У этого поведения есть точное математическое имя, и оно приходит именно из темы сегодняшнего урока.
Момент в стохастическом градиентном спуске — это не метафора и не эвристика «из воздуха». Если записать его в непрерывном времени, получится ровно линейное дифференциальное уравнение второго порядка с постоянными коэффициентами — то самое уравнение, которое физики столетиями пишут для пружинного маятника с трением или для разрядки конденсатора в электрической цепи. А то, произойдут ли колебания вокруг минимума или обучение сойдётся плавно без единого «перелёта», определяется одной-единственной вещью: типом корней характеристического уравнения. Различают действительные разные корни, действительные совпадающие корни и комплексно-сопряжённые корни — и это не абстрактная классификация ради классификации, а прямой ответ на вопрос «будет ли моя модель колебаться при обучении или сойдётся гладко».
Сегодняшний урок — прямое продолжение прошлого: там ты научился решать дифференциальные уравнения первого порядка в целом, включая метод разделения переменных. Теперь мы сузим фокус на особый, но невероятно важный класс уравнений — линейные. Начнём с линейного уравнения первого порядка и мощного трюка под названием «интегрирующий множитель», затем поднимемся до уравнений второго порядка с постоянными коэффициентами — сердца всей теории колебаний, устойчивости и, как ты уже понял, момента в оптимизации.
План на сегодня такой: сначала — линейное уравнение первого порядка и интегрирующий множитель как универсальный ключ к его решению. Затем — однородные линейные уравнения второго порядка и характеристическое уравнение с его тремя принципиально разными сценариями. После этого — неоднородные уравнения и метод подбора частного решения по виду правой части. И в конце — отдельный блок, где мы разберём момент в оптимизаторах именно как физическую систему с массой, трением и восстанавливающей силой, и увидим, как всё, что мы выучили про корни характеристического уравнения, буквально объясняет поведение реальных нейросетей во время обучения.
История: откуда это взялось?
Линейные дифференциальные уравнения с постоянными коэффициентами родились из задач механики XVIII века почти одновременно с самим математическим анализом. Леонард Эйлер в 1740-х годах первым систематически предложил искать решения уравнений вида $y''+py'+qy=0$ в виде экспоненты $y=e^{\lambda x}$ — идея, которая сегодня кажется очевидной студенту, но в своё время была настоящим прорывом: подставляя экспоненту в уравнение, Эйлер обнаружил, что производные экспоненты пропорциональны ей самой, а значит всё уравнение сводится к простому алгебраическому условию на показатель $\lambda$. Так родилось характеристическое уравнение — метод, которым мы пользуемся сегодня практически без изменений спустя почти три века.
Мотивация была насквозь физической. Уравнение $m\ddot x+\gamma\dot x+kx=0$ описывает колебания груза на пружине с трением — задачу, которую пытались решить механики ещё со времён Гюйгенса и его маятниковых часов. Три случая корней характеристического уравнения — действительные разные, действительные совпадающие и комплексные — прямо соответствуют трём физически различным режимам: чрезмерное трение гасит колебание, не дав ему даже начаться (передемпфирование), идеальный баланс трения и жёсткости даёт самое быстрое затухание без единого колебания (критическое демпфирование), а слабое трение позволяет системе несколько раз качнуться туда-сюда, прежде чем успокоиться (недодемпфирование). Позже, в XIX веке, эта же математика легла в основу теории электрических цепей — уравнение разрядки колебательного контура с катушкой индуктивности, резистором и конденсатором формально идентично уравнению пружинного маятника, только вместо массы, трения и жёсткости в нём фигурируют индуктивность, сопротивление и обратная ёмкость.
По-настоящему неожиданный поворот эта классическая механика получила в 1964 году, когда советский математик Борис Поляк предложил «метод тяжёлого шарика» для ускорения численной оптимизации — по сути, добавил в градиентный спуск слагаемое инерции, буквально позаимствованное из механики Ньютона. Идея оказалась настолько плодотворной, что сегодня почти ни один современный оптимизатор нейросетей (от классического стохастического градиентного спуска с моментом до Адама) не обходится без этого механического наследия. И когда практики жалуются, что обучение «раскачивается» при слишком большом моменте, они — часто не подозревая об этом — описывают ровно тот же переход через критическое демпфирование, который инженеры XIX века наблюдали в электрических цепях, а строители мостов XVIII века — в колебаниях подвесных конструкций.
Линейное уравнение первого порядка и интегрирующий множитель
Интуиция: как превратить уравнение в производную произведения
Давай разберёмся с самым простым, но невероятно полезным классом дифференциальных уравнений первого порядка — линейными. В прошлом уроке ты решал уравнения методом разделения переменных, когда $x$ и $y$ удавалось развести по разные стороны равенства. Но что делать, если переменные разделить нельзя — например, в уравнении $y'+y=e^x$, где справа стоит функция от $x$, а слева перемешаны и $y$, и $y'$?
Представь, что ты пытаешься собрать пазл, но одной детали не хватает. У тебя есть выражение $y'+p(x)y$, которое почти похоже на производную произведения $(uy)'=u'y+uy'$, но не совсем — не хватает множителя перед $y'$. Идея интегрирующего множителя в том, чтобы домножить всё уравнение на такую специально подобранную функцию $\mu(x)$, чтобы левая часть превратилась в производную произведения $\mu(x)\cdot y(x)$. После этого остаётся только проинтегрировать обе части — и уравнение решено.
Аналогия, которая может помочь: представь себе кодовый замок с двумя дисками, каждый из которых поворачивается независимо. Уравнение $y'+p(x)y=q(x)$ — это как замок, который заклинило, потому что диски скручены неправильно. Интегрирующий множитель $\mu(x)$ — это тот самый «поворот», который выравнивает оба диска в одну линию, после чего замок буквально открывается сам — уравнение сводится к тривиальному интегрированию.
Определение
Метод интегрирующего множителя. Линейное дифференциальное уравнение первого порядка имеет вид
$$y'+p(x)y=q(x)$$Домножим обе части на интегрирующий множитель
$$\mu(x)=e^{\int p(x)\,dx}$$Тогда левая часть уравнения превращается ровно в производную произведения $\mu(x)y(x)$:
$$\bigl(\mu(x)y(x)\bigr)'=\mu(x)q(x)$$Остаётся проинтегрировать обе части и выразить $y$:
$$y(x)=\frac{1}{\mu(x)}\left(\int \mu(x)q(x)\,dx+C\right)$$
Почему это работает — не магия, а прямая проверка по правилу дифференцирования произведения: $(\mu y)'=\mu'y+\mu y'$. Если $\mu'=\mu p$ (а именно так устроен наш множитель, поскольку $\mu=e^{\int p\,dx}$ даёт $\mu'=p\cdot e^{\int p\,dx}=p\mu$), то $(\mu y)'=\mu p y+\mu y'=\mu(y'+py)$ — в точности левая часть исходного уравнения, умноженная на $\mu$. Красота метода в том, что он универсален: он работает для любой непрерывной функции $p(x)$, будь то константа, степень $x$ или тригонометрическая функция.
Разбор примеров
Пример 1 (лёгкий). Найти общее решение уравнения $y'+y=e^x$.
Здесь $p(x)=1$, значит $\mu(x)=e^{\int 1\,dx}=e^x$. Домножаем уравнение на $\mu$:
$$(e^xy)'=e^x\cdot e^x=e^{2x}$$Интегрируем: $e^xy=\dfrac12e^{2x}+C$, откуда
$$y=\frac12e^x+Ce^{-x}$$Ответ: $y=\dfrac12e^x+Ce^{-x}$. Проверка: $y'=\dfrac12e^x-Ce^{-x}$, тогда $y'+y=\dfrac12e^x-Ce^{-x}+\dfrac12e^x+Ce^{-x}=e^x$ — совпадает с правой частью.
Пример 2 (средний). Найти частное решение уравнения $xy'-2y=x^3$ при $x>0$ с условием $y(1)=1$.
Приведём к стандартному виду, разделив на $x$: $y'-\dfrac2xy=x^2$. Значит $p(x)=-\dfrac2x$, и
$$\mu(x)=e^{\int-\frac2x\,dx}=e^{-2\ln x}=x^{-2}$$Домножаем уравнение на $x^{-2}$:
$$(x^{-2}y)'=x^{-2}\cdot x^2=1$$Интегрируем: $x^{-2}y=x+C$, откуда $y=x^3+Cx^2$. Применяем условие $y(1)=1$: $1+C=1$, значит $C=0$.
Ответ: $y=x^3$. Проверка: $y'=3x^2$, тогда $xy'-2y=3x^3-2x^3=x^3$ — совпадает.
Пример 3 (сложный, машинное обучение). Весовой распад (регуляризация, постепенно стягивающая веса к нулю) в непрерывном времени можно приближённо описать так: если локально градиент функции потерь почти постоянен и равен $g$, а коэффициент затухания весов равен $\lambda$, то траектория одного веса подчиняется линейному уравнению $\dfrac{dw}{dt}+\lambda w=-g$. Пусть $\lambda=0{,}5$, $g=2$, а начальный вес $w(0)=3$. Найти $w(t)$ и определить, к какому значению веса стремится система при $t\to\infty$.
Здесь $p(t)=0{,}5$ — константа, значит $\mu(t)=e^{0{,}5t}$. Домножаем уравнение на $\mu$:
$$(e^{0{,}5t}w)'=-2e^{0{,}5t}$$Интегрируем: $e^{0{,}5t}w=-2\cdot\dfrac{1}{0{,}5}e^{0{,}5t}+C=-4e^{0{,}5t}+C$, откуда
$$w(t)=-4+Ce^{-0{,}5t}$$Применяем начальное условие $w(0)=3$: $-4+C=3$, значит $C=7$. Итоговое решение: $w(t)=-4+7e^{-0{,}5t}$.
Ответ: $w(t)=-4+7e^{-0{,}5t}$. При $t\to\infty$ экспоненциальное слагаемое затухает до нуля, и вес стремится к $w\to-4$. Обрати внимание: это ровно точка равновесия $w^\*=-g/\lambda=-2/0{,}5=-4$, где сила притяжения градиента и сила распада весов взаимно уравновешиваются — то есть $\lambda w^\*=-g$. Это конкретная числовая иллюстрация общего факта: регуляризация весовым распадом не просто «тормозит» веса, а сдвигает точку равновесия оптимизации, и это смещение можно посчитать точно, зная только $\lambda$ и локальный градиент $g$, без единого шага реального обучения.
Почему это важно
Интегрирующий множитель — это не узкий трюк для одного типа уравнений, а универсальный метод, который сводит любое линейное уравнение первого порядка к паре шагов: найти $\mu(x)$, проинтегрировать. Он работает вне зависимости от того, насколько сложна функция $p(x)$ — будь то константа (как в наших примерах с весовым распадом) или переменная функция от $x$ (как в примере с $-2/x$). А ещё этот метод — важный концептуальный мостик к следующему разделу: ты увидишь, что для уравнений второго порядка с постоянными коэффициентами появляется похожая, но более мощная идея — тоже экспоненциальная подстановка, только теперь она рождает не просто множитель, а целое семейство базовых решений.
Однородное уравнение второго порядка: характеристическое уравнение
Интуиция: угадываем решение по его собственной природе
Давай разберёмся, как решать уравнения вида $y''+py'+qy=0$, где $p$ и $q$ — постоянные числа (это и называется «постоянными коэффициентами»). На первый взгляд задача выглядит пугающе: нужно найти функцию, которая после дифференцирования дважды, один раз и без изменений, взятые с определёнными коэффициентами, в сумме дают ноль. Но здесь работает та же идея, которую впервые применил Эйлер: попробуем искать решение в виде экспоненты $y=e^{\lambda x}$, потому что у экспоненты есть уникальное свойство — её производная любого порядка пропорциональна ей самой.
Представь, что функция $e^{\lambda x}$ — это «самоподобный» строительный блок: продифференцируй его сколько угодно раз, и снова получишь ту же самую экспоненту, только с множителем $\lambda$ в какой-то степени. Если подставить $y=e^{\lambda x}$ в уравнение $y''+py'+qy=0$, то $y'=\lambda e^{\lambda x}$, $y''=\lambda^2e^{\lambda x}$, и всё уравнение превращается в
$$\lambda^2e^{\lambda x}+p\lambda e^{\lambda x}+qe^{\lambda x}=0 \quad\Longrightarrow\quad e^{\lambda x}\left(\lambda^2+p\lambda+q\right)=0$$Поскольку $e^{\lambda x}$ никогда не равна нулю, всё уравнение сводится к простому алгебраическому условию на $\lambda$: квадратному уравнению $\lambda^2+p\lambda+q=0$. Это и есть характеристическое уравнение — вместо дифференциального уравнения ты решаешь обычную «школьную» квадратуру.
Определение
Характеристическое уравнение. Для линейного однородного уравнения второго порядка с постоянными коэффициентами
$$y''+py'+qy=0$$характеристическое уравнение имеет вид
$$\lambda^2+p\lambda+q=0$$Дискриминант $D=p^2-4q$ определяет тип корней и, соответственно, вид общего решения:
Случай 1 (действительные различные корни, $D>0$). Корни $\lambda_1\ne\lambda_2$ — оба действительные числа. Общее решение:
$$y=C_1e^{\lambda_1x}+C_2e^{\lambda_2x}$$Случай 2 (действительные совпадающие корни, $D=0$). Единственный корень $\lambda=-p/2$ кратности два. Общее решение:
$$y=(C_1+C_2x)e^{\lambda x}$$Случай 3 (комплексно-сопряжённые корни, $D<0$). Корни $\lambda=\alpha\pm i\beta$, где $\alpha=-p/2$, $\beta=\sqrt{4q-p^2}/2$. Общее решение:
$$y=e^{\alpha x}\bigl(C_1\cos\beta x+C_2\sin\beta x\bigr)$$
Почему во втором случае появляется дополнительный множитель $x$? Когда корень $\lambda$ единственный (кратный), простая экспонента $e^{\lambda x}$ даёт только одно независимое решение, а уравнение второго порядка требует двух независимых решений, чтобы можно было подобрать произвольные начальные условия. Второе решение находится домножением на $x$ — можно проверить прямой подстановкой, что $xe^{\lambda x}$ действительно удовлетворяет уравнению именно тогда, когда $\lambda$ — двойной корень. А в третьем случае комплексная экспонента $e^{(\alpha+i\beta)x}$ по формуле Эйлера раскладывается как $e^{\alpha x}(\cos\beta x+i\sin\beta x)$ — и, отделяя вещественную и мнимую части, мы получаем два действительных решения $e^{\alpha x}\cos\beta x$ и $e^{\alpha x}\sin\beta x$, из которых и складывается общее решение.
Разбор примеров
Пример 1 (лёгкий, действительные разные корни). Решить задачу Коши: $y''-3y'+2y=0$, $y(0)=1$, $y'(0)=0$.
Характеристическое уравнение: $\lambda^2-3\lambda+2=0$, раскладывается как $(\lambda-1)(\lambda-2)=0$, корни $\lambda_1=1$, $\lambda_2=2$ — действительные и разные. Общее решение: $y=C_1e^x+C_2e^{2x}$.
Применяем условия: $y(0)=C_1+C_2=1$. Далее $y'=C_1e^x+2C_2e^{2x}$, значит $y'(0)=C_1+2C_2=0$. Вычитая первое уравнение из второго: $C_2=-1$, откуда $C_1=2$.
Ответ: $y=2e^x-e^{2x}$. Проверка: $y(0)=2-1=1$ ✓, $y'(0)=2-2=0$ ✓.
Пример 2 (средний, кратный корень). Решить задачу Коши: $y''-4y'+4y=0$, $y(0)=3$, $y'(0)=1$.
Характеристическое уравнение: $\lambda^2-4\lambda+4=0$, то есть $(\lambda-2)^2=0$ — двойной корень $\lambda=2$. Общее решение: $y=(C_1+C_2x)e^{2x}$.
Применяем условия: $y(0)=C_1=3$. Для второго условия удобно пользоваться формулой $y'(0)=C_2+\lambda C_1$ (она следует из правила дифференцирования произведения): $C_2+2\cdot3=1$, откуда $C_2=-5$.
Ответ: $y=(3-5x)e^{2x}$. Проверка: $y'=-5e^{2x}+2(3-5x)e^{2x}$, при $x=0$: $-5+6=1$ ✓.
Пример 3 (сложный, комплексные корни). Решить задачу Коши: $y''+2y'+5y=0$, $y(0)=1$, $y'(0)=0$.
Характеристическое уравнение: $\lambda^2+2\lambda+5=0$, дискриминант $D=4-20=-16<0$. Корни: $\lambda=\dfrac{-2\pm\sqrt{-16}}{2}=-1\pm2i$, то есть $\alpha=-1$, $\beta=2$. Общее решение: $y=e^{-x}(C_1\cos2x+C_2\sin2x)$.
Применяем условия: $y(0)=C_1=1$. Для второго условия воспользуемся формулой $y'(0)=\alpha C_1+\beta C_2$: $-1\cdot1+2C_2=0$, откуда $C_2=0{,}5$.
Ответ: $y=e^{-x}\left(\cos2x+0{,}5\sin2x\right)$. Обрати внимание на структуру этого ответа: множитель $e^{-x}$ монотонно затухает до нуля, а скобка $\cos2x+0{,}5\sin2x$ бесконечно колеблется между положительными и отрицательными значениями. В результате график функции — это затухающая волна, которая всё слабее и слабее колеблется вокруг нуля. Именно такую картину ты увидишь чуть ниже, когда мы применим этот же аппарат к моменту в оптимизаторах.
Почему это важно
Три случая корней характеристического уравнения — это не техническая классификация ради классификации, а полная карта возможного поведения любой линейной системы второго порядка с постоянными коэффициентами: только рост-и-затухание без колебаний (случай 1), самое быстрое возможное затухание без единого колебания (случай 2, ровно на границе) или неизбежные колебания на пути к равновесию (случай 3). Эта же классификация без единого изменения переносится на маятники, электрические цепи, химическую кинетику и, как мы скоро увидим, на динамику обучения нейросети с моментом. Умение по одному взгляду на коэффициенты $p$ и $q$ (а точнее, на знак дискриминанта $D=p^2-4q$) сказать, какой из трёх сценариев тебя ждёт, — одна из самых практически полезных интуиций во всей теории дифференциальных уравнений.
Неоднородное уравнение второго порядка: метод подбора частного решения
Интуиция: общее решение как сумма «свободного колебания» и «вынужденного отклика»
Давай разберёмся, что происходит, когда в правой части уравнения появляется не ноль, а какая-то функция: $y''+py'+qy=f(x)$. Физически это означает, что на систему (маятник, электрическую цепь, веса модели) действует внешняя вынуждающая сила $f(x)$, а не только внутренние силы жёсткости и трения. Интуиция здесь та же, что и при решении линейных алгебраических систем: полный отклик системы раскладывается на «свободное» поведение (то, что происходило бы вообще без внешней силы) и «вынужденный» отклик (конкретная реакция именно на эту силу).
Формально это записывается так: если $y_o$ — общее решение соответствующего однородного уравнения $y''+py'+qy=0$ (то, что мы разобрали в предыдущем разделе), а $y_\text{ч}$ — любое одно частное решение неоднородного уравнения, то общее решение неоднородного уравнения равно их сумме:
$$y=y_o+y_\text{ч}$$Почему это работает — прямое следствие линейности оператора дифференцирования. Проверим: если $L(y)=y''+py'+qy$ обозначает наш дифференциальный оператор, то $L(y_o+y_\text{ч})=L(y_o)+L(y_\text{ч})=0+f(x)=f(x)$ — сумма действительно удовлетворяет неоднородному уравнению. А раз $y_o$ уже содержит две произвольные константы $C_1,C_2$, эта сумма автоматически охватывает все возможные решения — большего от общего решения и не требуется.
Метод подбора частного решения (метод неопределённых коэффициентов)
Метод подбора частного решения. Для правых частей специального вида — многочлен, экспонента, синус/косинус или их произведение — частное решение $y_\text{ч}$ ищется в том же виде, что и $f(x)$, с неизвестными коэффициентами, которые находятся подстановкой в уравнение.
Если многочлен степени $n$ (или экспонента, или синус/косинус) резонирует с характеристическим уравнением — то есть показатель экспоненты совпадает с корнем, или частота синуса/косинуса совпадает с мнимой частью комплексного корня — пробное решение нужно домножить на $x$ в степени кратности этого совпадения. Без этого домножения подстановка приведёт к тождественному нулю вместо уравнения на коэффициенты.
Резонанс — не редкое исключение, а важный содержательный случай: он означает, что внешняя вынуждающая сила «раскачивает» систему ровно в такт с её собственными, свободными колебаниями. Физически это классический эффект резонанса — марширующая рота солдат, случайно попавшая в такт с собственной частотой моста, может раскачать его до разрушения; то же самое происходит и здесь на уровне уравнения.
Разбор примеров
Пример 1 (лёгкий, правая часть — многочлен). Найти общее решение уравнения $y''-y'-2y=4x$.
Характеристическое уравнение однородной части: $\lambda^2-\lambda-2=0$, то есть $(\lambda-2)(\lambda+1)=0$, корни $2$ и $-1$. Значит $y_o=C_1e^{2x}+C_2e^{-x}$.
Правая часть — многочлен первой степени, резонанса нет (ноль не является корнем характеристического уравнения). Ищем $y_\text{ч}=Ax+B$. Тогда $y_\text{ч}'=A$, $y_\text{ч}''=0$. Подставляем:
$$0-A-2(Ax+B)=4x \quad\Longrightarrow\quad -2Ax+(-A-2B)=4x+0$$Сравнивая коэффициенты: $-2A=4$, значит $A=-2$; и $-A-2B=0$, значит $2-2B=0$, откуда $B=1$.
Ответ: $y=C_1e^{2x}+C_2e^{-x}-2x+1$.
Пример 2 (средний, резонанс с экспонентой). Найти общее решение уравнения $y''-3y'+2y=e^x$.
Характеристическое уравнение $\lambda^2-3\lambda+2=0$ даёт корни $1$ и $2$. Показатель правой части равен $1$ — он совпадает с корнем $\lambda_1=1$, значит здесь резонанс, и пробное решение нужно искать в виде $y_\text{ч}=Axe^x$ (а не просто $Ae^x$).
Находим производные: $y_\text{ч}'=A(1+x)e^x$, $y_\text{ч}''=A(2+x)e^x$. Подставляем в уравнение:
$$A(2+x)e^x-3A(1+x)e^x+2Axe^x=e^x$$Раскрываем скобку при $e^x$: $A\bigl[(2+x)-3(1+x)+2x\bigr]=A\bigl[2+x-3-3x+2x\bigr]=A\cdot(-1)=-A$. Значит $-A=1$, откуда $A=-1$.
Ответ: $y=C_1e^x+C_2e^{2x}-xe^x$. Обрати внимание: если бы мы (по ошибке) искали частное решение в виде $Ae^x$ без множителя $x$, оно бы совпало с частью однородного решения $C_1e^x$ и после подстановки дало бы тождественный ноль — сигнал, что мы забыли учесть резонанс.
Пример 3 (сложный, машинное обучение — опасность резонанса). Рассмотрим недемпфированную колебательную систему $y''+9y=6\sin3x$ — модель ситуации, когда собственная частота колебаний весов (при обучении без трения, то есть без затухания) равна $3$, и при этом внешнее периодическое возмущение — например, периодическая структура батчей или циклический график скорости обучения — тоже действует с частотой $3$, то есть ровно в резонанс. Найти общее решение и объяснить, что происходит с амплитудой колебаний при $x\to\infty$.
Характеристическое уравнение: $\lambda^2+9=0$, корни $\lambda=\pm3i$ — чисто мнимые, $\alpha=0$, $\beta=3$. Значит $y_o=C_1\cos3x+C_2\sin3x$ — незатухающие колебания собственной частоты $3$.
Правая часть $6\sin3x$ имеет частоту $3$, которая совпадает с $\beta=3$ — резонанс. Ищем $y_\text{ч}=x(A\cos3x+B\sin3x)$. После дифференцирования (дважды по правилу произведения) и подстановки в уравнение все члены с $x\cos3x$ и $x\sin3x$ взаимно уничтожаются, и остаётся:
$$y_\text{ч}''+9y_\text{ч}=6B\cos3x-6A\sin3x$$Приравнивая к правой части $6\sin3x=0\cdot\cos3x+6\sin3x$: $6B=0$, значит $B=0$; и $-6A=6$, значит $A=-1$.
Ответ: $y_\text{ч}=-x\cos3x$, общее решение $y=C_1\cos3x+C_2\sin3x-x\cos3x$. Слагаемое $-x\cos3x$ растёт по амплитуде линейно с ростом $x$ — колебания не затухают, а, наоборот, набирают размах без ограничения. Это математически точное объяснение классического инженерного правила: если периодическое возмущение системы совпадает по частоте с её собственными, незатухающими колебаниями, амплитуда раскачки растёт неограниченно. В оптимизации это предупреждение звучит так: если циклический график скорости обучения (или любая другая периодическая компонента процедуры обучения) случайно совпадает по частоте с собственными колебаниями слабо демпфированного оптимизатора, вместо ускорения обучения можно получить нарастающую нестабильность — эффект, аналогичный тому, как марширующая рота раскачивает мост в резонанс с его собственной частотой.
Почему это важно
Метод подбора частного решения превращает решение неоднородного уравнения в чисто алгебраическую задачу: угадать форму ответа, подставить, сравнить коэффициенты. Но самое важное здесь — не техника, а идея резонанса: правая часть, «попадающая в такт» с собственными колебаниями системы, вызывает качественно иной, неограниченно растущий отклик — совсем не такой, как для любой другой частоты. Эта интуиция окажется решающей в следующем разделе, где мы разберём, как реальные оптимизаторы с моментом могут либо гладко сходиться, либо колебаться вокруг минимума — в зависимости от того, в какой из трёх режимов характеристического уравнения они попадают.
Момент в оптимизации как линейное дифференциальное уравнение
Интуиция: момент — это буквально инерция физического тела
Давай разберёмся, откуда вообще в оптимизаторах взялась идея момента. Обычный градиентный спуск обновляет веса по формуле $w_{t+1}=w_t-\eta\nabla L(w_t)$ — веса всегда движутся строго в направлении антиградиента, как капля воды, которая мгновенно меняет направление при любом изменении наклона поверхности. Момент добавляет к этому «инерцию»: вместо мгновенного следования за градиентом обновление весов накапливает «скорость» $v$, которая лишь постепенно подстраивается под текущий градиент:
$$v_{t+1}=\beta v_t-\eta\nabla L(w_t), \qquad w_{t+1}=w_t+v_{t+1}$$Идея эта — не программистская придумка, а прямое заимствование из механики Ньютона. Представь шарик, катящийся по холмистой поверхности функции потерь: у настоящего физического шарика есть масса, а значит и инерция — он не может мгновенно остановиться или развернуться, даже если наклон поверхности под ним резко изменился. Именно такое поведение и моделирует момент. Метод, который в 1964 году предложил Борис Поляк, так и называется — «метод тяжёлого шарика», и в непрерывном времени (при устремлении шага дискретизации к нулю) дискретная формула момента в точности превращается в уравнение движения физического тела с трением:
$$\mu\ddot w+\gamma\dot w+\nabla L(w)=0$$где $\mu$ играет роль «массы» (связана с коэффициентом момента $\beta$), а $\gamma$ — роль «трения» или «вязкого сопротивления» (связана с обратной величиной скорости обучения $\eta$ и с самим $\beta$).
Формальный вывод: квадратичный минимум как пружина
Метод: момент как затухающий гармонический осциллятор. Вблизи минимума функцию потерь можно приближённо считать квадратичной: $L(w)\approx\dfrac k2(w-w^\*)^2$, где $w^\*$ — точка минимума, а $k>0$ — кривизна (вторая производная) в этой точке. Тогда $\nabla L(w)=k(w-w^\*)$, и, вводя отклонение от минимума $x=w-w^\*$, непрерывное уравнение момента принимает вид
$$\mu\ddot x+\gamma\dot x+kx=0$$— линейное однородное уравнение второго порядка с постоянными коэффициентами, в точности такое, как в предыдущем разделе (только с $\mu$ вместо коэффициента при старшей производной). Характеристическое уравнение $\mu\lambda^2+\gamma\lambda+k=0$ имеет дискриминант $D=\gamma^2-4\mu k$, и именно его знак решает судьбу обучения:
- Передемпфирование ($\gamma^2>4\mu k$, действительные разные корни) — веса плавно, монотонно сходятся к минимуму без единого «перелёта», но, возможно, медленнее, чем могли бы.
- Критическое демпфирование ($\gamma^2=4\mu k$, кратный корень) — самая быстрая возможная сходимость без единого колебания. Это «золотая середина» настройки момента.
- Недодемпфирование ($\gamma^2<4\mu k$, комплексные корни) — веса колеблются вокруг минимума с постепенно затухающей амплитудой: именно та осциллирующая кривая функции потерь, о которой шла речь в самом начале урока.
Практический вывод из этой формулы прямой: слишком большой коэффициент момента $\beta$ (что соответствует большой эффективной «массе» $\mu$ при фиксированном трении $\gamma$) сдвигает систему в сторону недодемпфирования — обучение начинает колебаться. И наоборот, момент, подобранный так, что дискриминант близок к нулю, даёт самую быструю практически достижимую сходимость без единого «перелёта» через минимум.
Разбор примеров
Пример 1 (лёгкий, передемпфирование). Пусть эффективная «масса» $\mu=1$, «трение» $\gamma=5$, кривизна потерь $k=4$. Начальное отклонение веса от минимума $x(0)=1$, стартовая «скорость» $\dot x(0)=0$ (обучение начинается «с места», без начального импульса). Найти $x(t)$ и определить режим.
Уравнение: $\ddot x+5\dot x+4x=0$. Характеристическое уравнение $\lambda^2+5\lambda+4=0$ раскладывается как $(\lambda+1)(\lambda+4)=0$, корни $\lambda_1=-1$, $\lambda_2=-4$ — оба действительные, разные и отрицательные. Это передемпфирование: дискриминант $D=25-16=9>0$.
Общее решение: $x=C_1e^{-t}+C_2e^{-4t}$. Применяем условия: $x(0)=C_1+C_2=1$; $\dot x=-C_1e^{-t}-4C_2e^{-4t}$, значит $\dot x(0)=-C_1-4C_2=0$. Из второго уравнения $C_1=-4C_2$; подставляя в первое: $-4C_2+C_2=1$, значит $C_2=-\dfrac13$, откуда $C_1=\dfrac43$.
Ответ: $x(t)=\dfrac43e^{-t}-\dfrac13e^{-4t}$. Оба слагаемых монотонно убывают до нуля, ни одна из экспонент не меняет знак, а значит отклонение $x(t)$ гладко стремится к нулю без единого пересечения нуля — веса подходят к минимуму «сверху», не проскакивая его.
Пример 2 (средний, критическое демпфирование). По кривизне потерь $k=8$ и эффективной «массе» $\mu=2$ подобрать коэффициент трения $\gamma$, дающий критическое демпфирование, и найти $x(t)$ при $x(0)=3$, $\dot x(0)=0$.
Критическое демпфирование требует $\gamma^2=4\mu k=4\cdot2\cdot8=64$, значит $\gamma=8$ (берём положительный корень, поскольку трение по своей физической природе неотрицательно). Уравнение: $2\ddot x+8\dot x+8x=0$, делим на $2$: $\ddot x+4\dot x+4x=0$. Характеристическое уравнение $\lambda^2+4\lambda+4=0$, то есть $(\lambda+2)^2=0$ — двойной корень $\lambda=-2$.
Общее решение: $x=(C_1+C_2t)e^{-2t}$. Применяем условия: $x(0)=C_1=3$; по формуле $\dot x(0)=C_2+\lambda C_1$ получаем $C_2+(-2)\cdot3=0$, откуда $C_2=6$.
Ответ: $x(t)=(3+6t)e^{-2t}$. Это самый быстрый возможный способ вернуться к минимуму без единого колебания — «золотая настройка» момента, к которой стремятся на практике при подборе гиперпараметров оптимизатора.
Пример 3 (сложный, недодемпфирование — «слишком большой момент»). Пусть $\mu=1$, $\gamma=2$, $k=5$, $x(0)=1$, $\dot x(0)=0$. Найти $x(t)$ и объяснить поведение обучения.
Уравнение: $\ddot x+2\dot x+5x=0$. Характеристическое уравнение $\lambda^2+2\lambda+5=0$, дискриминант $D=4-20=-16<0$ — недодемпфирование. Корни: $\lambda=-1\pm2i$, то есть $\alpha=-1$, $\beta=2$.
Общее решение: $x=e^{-t}(C_1\cos2t+C_2\sin2t)$. Применяем условия: $x(0)=C_1=1$; по формуле $\dot x(0)=\alpha C_1+\beta C_2$ получаем $-1\cdot1+2C_2=0$, откуда $C_2=0{,}5$.
Ответ: $x(t)=e^{-t}\left(\cos2t+0{,}5\sin2t\right)$. Множитель $\cos2t+0{,}5\sin2t$ бесконечно колеблется между положительными и отрицательными значениями, а множитель $e^{-t}$ постепенно гасит эти колебания. В переводе на язык обучения: вес несколько раз «проскакивает» минимум в обе стороны, каждый раз слабее, прежде чем окончательно успокаивается вблизи него, — именно та раскачивающаяся кривая функции потерь, с которой мы начали сегодняшний урок. Уменьшение коэффициента момента (что увеличивает эффективное трение $\gamma$) или уменьшение скорости обучения (что снижает эффективную кривизну $k$, действующую на систему) сдвигает дискриминант $D=\gamma^2-4\mu k$ в положительную сторону и убирает колебания.
Почему это важно
Это, пожалуй, самая практичная интуиция из всего сегодняшнего урока: настройка момента в оптимизаторе нейросети — это в буквальном смысле настройка дискриминанта характеристического уравнения затухающего осциллятора. Когда инженер по машинному обучению видит на графике обучения затухающие колебания функции потерь, он смотрит ровно на ту же самую математику, что инженер-электротехник видит в разрядке электрического колебательного контура, а инженер-строитель — в колебаниях моста после порыва ветра. Понимание этой связи превращает подбор момента из «магии гиперпараметров методом тыка» в осознанную настройку физически понятной системы — а заодно объясняет, почему сложные адаптивные оптимизаторы вроде Адама или момента Нестерова по сути представляют собой попытки автоматически держать эту систему как можно ближе к критическому демпфированию на каждом шаге обучения.
Практика: 30 заданий
Базовые задания (1–10)
Задание 1: Найти общее решение уравнения $y'+y=e^{2x}$.
Задание 2: Найти общее решение уравнения $xy'+y=x^2$ при $x>0$.
Задание 3: Найти общее решение однородного уравнения $y''-5y'+6y=0$.
Задание 4: Найти общее решение однородного уравнения $y''-6y'+9y=0$.
Задание 5: Найти общее решение однородного уравнения $y''+9y=0$.
Задание 6: Решить задачу Коши $y''-y=0$, $y(0)=2$, $y'(0)=0$.
Задание 7: Найти общее решение уравнения $y''-y'-6y=18$.
Задание 8: Найти общее решение уравнения $y'+3y=6$.
Задание 9 (машинное обучение): Весовой распад без внешнего градиента: $\dfrac{dw}{dt}+0{,}1w=0$, $w(0)=5$. Найти $w(t)$ и точку равновесия.
Задание 10 (машинное обучение): Определить режим системы $\ddot x+6\dot x+9x=0$ и найти $x(t)$ при $x(0)=1$, $\dot x(0)=-2$.
Средние задания (11–20)
Задание 11: Найти общее решение уравнения $y'+2xy=x$.
Задание 12: Решить задачу Коши $y'-\dfrac1xy=x^2$, $y(1)=0$, при $x>0$.
Задание 13: Решить задачу Коши $y''+2y'+y=0$, $y(0)=1$, $y'(0)=3$.
Задание 14: Решить задачу Коши $y''-2y'+5y=0$, $y(0)=0$, $y'(0)=1$.
Задание 15: Найти общее решение уравнения $y''-4y=8x^2$.
Задание 16: Найти общее решение уравнения $y''+y'-2y=3e^{-3x}$.
Задание 17: Найти общее решение уравнения $y''-3y'+2y=e^x$ (используя корни из задания про $y''-3y'+2y=0$).
Задание 18 (машинное обучение): Скорость обучения с линейно растущей целевой добавкой: $\dfrac{dw}{dt}+2w=4t$. Найти $w(t)$.
Задание 19 (машинное обучение): Определить режим системы $\ddot x+3\dot x+2x=0$ и найти $x(t)$ при $x(0)=4$, $\dot x(0)=-1$.
Задание 20 (машинное обучение): Определить режим системы $\ddot x+2\dot x+10x=0$ и найти $x(t)$ при $x(0)=0$, $\dot x(0)=3$.
Продвинутые задания (21–30)
Задание 21: Решить задачу Коши $y'+y\tan x=\cos x$, $y(0)=0$, на интервале $\left(-\dfrac\pi2,\dfrac\pi2\right)$.
Задание 22: Найти общее решение уравнения $y''+9y=6\sin3x$ (резонанс).
Задание 23: Найти общее решение уравнения $y''-y'-2y=5e^{-x}$ (резонанс).
Задание 24: Решить задачу Коши $y''-4y'+4y=e^{2x}$, $y(0)=1$, $y'(0)=0$ (резонанс с двойным корнем).
Задание 25 (машинное обучение): По кривизне $k=8$ и «массе» $\mu=2$ подобрать критическое трение $\gamma$ и найти $x(t)$ при $x(0)=3$, $\dot x(0)=0$.
Задание 26 (машинное обучение): Найти $x(t)$ для уравнения $\ddot x+2\dot x+5x=10$ при $x(0)=0$, $\dot x(0)=0$ (постоянное смещение минимума, например из-за регуляризационного сдвига).
Задание 27 (машинное обучение): Найти $x(t)$ для $\ddot x+9x=6\cos3t$ при $x(0)=0$, $\dot x(0)=0$ — резонанс периодического возмущения с собственной частотой недемпфированной системы.
Задание 28 (машинное обучение): Учесть затухающий график скорости обучения $\eta(t)=\dfrac2{1+t}$: решить $\dfrac{dw}{dt}+\dfrac{2}{1+t}w=0$, $w(0)=5$.
Задание 29: Найти все решения уравнения $y''-y'-6y=e^{2x}$, ограниченные при $x\to-\infty$.
Задание 30 (машинное обучение): Направление отрицательной кривизны у седловой точки: $\ddot x+3\dot x-4x=0$ (кривизна $k=-4<0$), $x(0)=0{,}01$, $\dot x(0)=0$. Найти $x(t)$ и объяснить поведение при $t\to\infty$.
Частые ошибки
Даже отличное понимание теории не спасает от типичных технических промахов — вот на что стоит обратить особое внимание.
-
Путают знак в показателе экспоненты интегрирующего множителя: $\mu(x)=e^{\int p(x)\,dx}$, а не $e^{-\int p(x)\,dx}$ — знак минус появляется только в самой формуле уравнения $y'+p(x)y=q(x)$, а не в множителе.
-
Пытаются применить метод неопределённых коэффициентов к уравнениям с переменными коэффициентами (то есть когда $p$ или $q$ зависят от $x$) или к «неудобной» правой части вроде $\tan x$ или $1/x$ — метод подбора работает только для постоянных коэффициентов и правых частей вида многочлен × экспонента × (синус или косинус).
-
Забывают проверить резонанс перед тем, как подставлять пробное решение: если показатель экспоненты (или частота синуса/косинуса) совпадает с корнем характеристического уравнения, пробное решение без множителя $x$ после подстановки даст тождественный ноль вместо уравнения на коэффициенты.
-
Путают знаки при переходе от $ay''+by'+cy=0$ к характеристическому уравнению $a\lambda^2+b\lambda+c=0$ — особенно когда $b$ или $c$ отрицательны.
-
Для комплексных корней записывают решение через сами комплексные числа $\lambda=\alpha\pm i\beta$ в показателе экспоненты, вместо того чтобы сразу перейти к вещественной форме $e^{\alpha x}(C_1\cos\beta x+C_2\sin\beta x)$.
-
Считают, что частное решение неоднородного уравнения $y_\text{ч}$ само по себе является полным ответом, забывая прибавить общее решение однородного уравнения $y_o$.
-
В контексте момента путают знак коэффициента трения $\gamma$: он должен быть неотрицательным, иначе вместо затухающих колебаний уравнение начинает описывать растущие — физически бессмысленный сценарий «отрицательного трения», который разгоняет систему, а не гасит её.
Главное запомнить
-
Линейное уравнение первого порядка $y'+p(x)y=q(x)$ решается через интегрирующий множитель $\mu(x)=e^{\int p(x)\,dx}$, который превращает левую часть в производную произведения $(\mu y)'$.
-
Для однородного уравнения второго порядка $y''+py'+qy=0$ решение ищется в виде $y=e^{\lambda x}$, что сводит задачу к характеристическому уравнению $\lambda^2+p\lambda+q=0$.
-
Дискриминант характеристического уравнения $D=p^2-4q$ определяет три принципиально разных сценария поведения решения.
-
При $D>0$ (действительные разные корни): $y=C_1e^{\lambda_1x}+C_2e^{\lambda_2x}$ — монотонное поведение без колебаний.
-
При $D=0$ (кратный корень): $y=(C_1+C_2x)e^{\lambda x}$ — второе решение получено домножением на $x$.
-
При $D<0$ (комплексно-сопряжённые корни): $y=e^{\alpha x}(C_1\cos\beta x+C_2\sin\beta x)$ — затухающие или нарастающие колебания в зависимости от знака $\alpha$.
-
Общее решение неоднородного уравнения равно сумме общего решения однородного и любого частного решения неоднородного: $y=y_o+y_\text{ч}$.
-
При подборе частного решения обязательно проверяй резонанс — совпадение вида правой части с однородным решением требует домножения пробного решения на $x$ (или $x^2$ при кратном совпадении).
-
Оптимизатор с моментом в непрерывном времени — это линейное уравнение $\mu\ddot x+\gamma\dot x+kx=0$, а дискриминант $\gamma^2-4\mu k$ определяет, будет ли обучение колебаться вокруг минимума.
-
Критическое демпфирование ($\gamma^2=4\mu k$) даёт самую быструю сходимость без единого «перелёта» через минимум — ориентир при настройке момента на практике.
Связь с другими темами курса
Этот урок напрямую продолжает дифференциальные уравнения первого порядка: там разделение переменных решало широкий, но не всегда удобный класс уравнений, а здесь для линейных уравнений появился специальный, гораздо более систематичный инструмент — интегрирующий множитель. Характеристическое уравнение для однородных линейных уравнений с постоянными коэффициентами — прямая подготовка к системам дифференциальных уравнений: любое уравнение второго порядка можно переписать как систему двух уравнений первого порядка, а характеристическое уравнение окажется в точности уравнением на собственные значения матрицы этой системы — том самом объекте линейной алгебры, который определяет устойчивость и поведение траекторий. Формула Эйлера, связывающая комплексную экспоненту с синусом и косинусом, здесь используется в точности так же, как и при работе с комплексными числами и рядами Фурье — ещё одна нить, которая свяжет этот урок с более поздними темами курса. А метод подбора частного решения по виду правой части — это частный, но крайне практичный случай общей идеи «действовать сообразно структуре задачи», с которой ты уже сталкивался при интегрировании по частям и при разложении рациональных функций на простые дроби.
Интересные факты
-
Уравнение затухающего осциллятора $m\ddot x+\gamma\dot x+kx=0$ формально идентично уравнению разрядки колебательного контура в электротехнике — только массу, трение и жёсткость пружины заменяют индуктивность, сопротивление и обратная ёмкость конденсатора. Одна и та же математика описывает механические колебания и электрические цепи.
-
Метод тяжёлого шарика, который лежит в основе почти всех современных оптимизаторов с моментом, был предложен Борисом Поляком в 1964 году — задолго до появления глубокого обучения в его современном виде, изначально для гораздо более общих задач численной оптимизации.
-
Критическое демпфирование используется не только в теории, но и в повседневной инженерии: доводчики дверей и амортизаторы автомобилей специально настраиваются как можно ближе к критическому демпфированию, чтобы дверь закрывалась (а колесо возвращалось в исходное положение после кочки) максимально быстро, но без единого «дребезжащего» колебания.
-
Термин «характеристическое уравнение» не случайно совпадает по названию с характеристическим уравнением матрицы в линейной алгебре (для нахождения собственных значений) — это буквально один и тот же математический объект, и явная связь между ними раскроется в следующем уроке про системы дифференциальных уравнений.
Лайфхаки и полезные трюки
-
Прежде чем дифференцировать пробное решение при методе подбора, сразу сравни показатель экспоненты (или частоту синуса/косинуса) правой части с корнями характеристического уравнения — если совпадения нет, экономишь время на «лишнем» множителе $x$; если совпадение есть, сразу знаешь, что множитель нужен.
-
Для проверки любого найденного решения дифференциального уравнения всегда подставляй его обратно в исходное уравнение целиком, а не только проверяй начальные условия — подогнанное (но неверное) общее решение может случайно удовлетворить начальным условиям, но не самому уравнению.
-
Если правая часть неоднородного уравнения — сумма нескольких «простых» слагаемых (например, многочлен плюс экспонента), используй принцип суперпозиции: найди частное решение для каждого слагаемого отдельно и просто сложи результаты — линейность оператора это гарантирует.
-
Для быстрого применения начальных условий к кратному корню используй короткую формулу $y'(0)=C_2+\lambda C_1$, а для комплексных корней — формулу $y'(0)=\alpha C_1+\beta C_2$: обе выводятся за одну строчку из правила дифференцирования произведения и избавляют от лишних вычислений.
-
Чтобы быстро понять, будет ли оптимизатор с моментом колебаться, не решай уравнение целиком — посчитай только знак дискриминанта $\gamma^2-4\mu k$; этого достаточно, чтобы ответить на вопрос «колебания или гладкая сходимость» без единой лишней выкладки.
-
Если интегрирующий множитель $\mu(x)$ получается через логарифм (как в примерах с $p(x)=n/x$), не бойся отрицательных или дробных степеней $x$ — почти всегда результат аккуратно сворачивается в чистую степенную функцию.
Линейные дифференциальные уравнения второго порядка — это тот редкий случай, когда абстрактная алгебра квадратного уравнения напрямую управляет поведением реального физического (и вычислительного) мира: от маятниковых часов Гюйгенса и мостов, разрушенных резонансом марширующих солдат, до кривой функции потерь на экране твоего монитора во время обучения нейросети. В следующий раз, когда увидишь, как функция потерь на графике плавно колеблется, затухая к минимуму, — ты будешь точно знать, что смотришь на решение линейного дифференциального уравнения с комплексно-сопряжёнными корнями характеристического уравнения, и будешь точно знать, какой параметр покрутить, чтобы это исправить.
Понял тему? Закрепи в боте! 🚀
Попрактикуйся на задачах и получи персональные рекомендации от AI
💪 Начать тренировку