🔴 Сложный ⏱️ 55 минут

Дифференциальные уравнения 1-го порядка

📋 Содержание урока

Дифференциальные уравнения 1-го порядка 🧭

Давай разберёмся с одной из самых мощных идей во всей математике: уравнением, в котором неизвестна не число, а целая функция, и связано это уравнение не с самим значением функции, а с тем, как быстро она меняется. Звучит абстрактно, но интуиция здесь предельно простая. Представь, что ты знаешь только одно: скорость автомобиля в каждый момент времени. Одометр сломан, но спидометр работает исправно. Можно ли восстановить пройденный путь? Можно — нужно проинтегрировать скорость по времени. А теперь усложним задачу: что, если сама скорость зависит от того, где ты сейчас находишься — например, автомобиль тормозит тем сильнее, чем ближе он к финишу? Тогда скорость и положение переплетены друг с другом в единое уравнение, и найти закон движения — значит решить дифференциальное уравнение. Именно с таких уравнений, связывающих функцию и её производную, начинается целая наука о динамике: как что-то меняется во времени или в пространстве.

Здесь у нас появляется первая по-настоящему важная связь с машинным обучением, ради которой этот урок стоит того, чтобы вникнуть в него глубоко, если твоя конечная цель — не классическая механика, а нейросети. Обучение модели — это процесс, в котором веса $w$ шаг за шагом двигаются в сторону уменьшения функции потерь $L(w)$ по правилу градиентного спуска: $w_{n+1}=w_n-\eta\nabla L(w_n)$. А теперь представь, что шаг обучения $\eta$ становится бесконечно малым, а число шагов — бесконечно большим, так что дискретная последовательность точек превращается в непрерывную траекторию $w(t)$. Что получится в пределе? Ровно дифференциальное уравнение первого порядка:

$$\frac{dw}{dt}=-\nabla L(w(t))$$

Это уравнение называют непрерывным градиентным спуском, и оно — не просто красивая метафора, а строгий предельный случай реального алгоритма обучения. Понимание того, как вообще устроены дифференциальные уравнения первого порядка, как их решать и как читать их геометрически, — это прямой путь к пониманию того, почему градиентный спуск сходится (или не сходится), почему скорость обучения ведёт себя так, как ведёт, и что вообще происходит с весами модели «между» дискретными шагами оптимизатора.

Более того, эта идея выросла в полноценную архитектуру нейросетей — Neural ODE, где вместо привычных дискретных слоёв $h_{n+1}=h_n+f(h_n,\theta_n)$ используется непрерывная эволюция скрытого состояния, задаваемая дифференциальным уравнением $\dfrac{dh}{dt}=f(h(t),t,\theta)$, в котором правая часть $f$ — сама нейросеть с обучаемыми параметрами $\theta$. Вместо конечного набора слоёв ResNet ты получаешь «бесконечно глубокую» сеть, чья глубина измеряется не количеством слоёв, а временем интегрирования дифференциального уравнения. Мы вернёмся к этой идее подробнее в разделе с интересными фактами, но уже сейчас держи в голове главное: то, чему посвящён этот урок, — это не изолированный раздел математического анализа, а прямой фундамент под целым классом современных архитектур и под самим механизмом обучения.

Сегодняшний план такой: сначала дадим строгое определение дифференциального уравнения первого порядка и разберёмся, что вообще значит «решить» такое уравнение. Затем разберём принципиальную разницу между общим и частным решением и узнаем, как задача Коши (начальное условие) выбирает единственную кривую из целого семейства. После этого освоим два конкретных метода решения — уравнения с разделяющимися переменными и однородные уравнения через замену $y=vx$. И завершим урок геометрическим взглядом на всё происходящее — полем направлений, которое превращает абстрактную формулу в наглядную картинку из маленьких стрелочек.

История: откуда это взялось?

Дифференциальные уравнения родились не из отвлечённой любви к формулам, а из самой что ни на есть практической задачи — понять законы движения. В 1665–1666 годах, спасаясь от чумы в деревне, Исаак Ньютон сформулировал свои законы механики и параллельно изобрёл аппарат, который сегодня называется дифференциальным и интегральным исчислением. Ключевое наблюдение Ньютона звучало примерно так: если известна сила, действующая на тело, то известно и его ускорение (второй закон Ньютона, $F=ma$), а ускорение — это производная скорости, скорость — производная положения. Значит, зная силу как функцию положения и времени, ты получаешь дифференциальное уравнение, решение которого и есть траектория движения тела. Легенда о падающем яблоке — не просто красивая история: именно вопрос «по какому закону падает тело под действием силы тяжести» и есть одно из первых в истории дифференциальных уравнений, которое было явно решено.

Независимо от Ньютона, примерно в то же время, Готфрид Вильгельм Лейбниц разработал собственный вариант дифференциального и интегрального исчисления — с гораздо более удобными и дожившими до наших дней обозначениями $dy$, $dx$, $\int$. Именно Лейбниц ввёл саму идею записи $dy/dx$ как отношения бесконечно малых приращений, и эта запись оказалась настолько удачной, что мы пользуемся ей до сих пор, хотя строгое обоснование бесконечно малых величин появилось значительно позже, уже в XIX веке, в работах Коши и Вейерштрасса. Спор о приоритете между сторонниками Ньютона и Лейбница растянулся на десятилетия и надолго рассорил английскую и континентальную математические школы, но по факту оба мыслителя пришли к одной и той же фундаментальной идее с разных сторон.

В XVIII веке эстафету подхватили Якоб и Иоганн Бернулли, Леонард Эйлер и позже Жозеф Луи Лагранж, которые начали систематически классифицировать типы дифференциальных уравнений и разрабатывать методы их решения — в том числе метод разделения переменных и приёмы для однородных уравнений, которые ты изучишь в этом уроке практически в том же виде, в каком их вывели три века назад. Что особенно показательно: почти все классические задачи механики — от движения маятника до формы висящей под собственным весом цепи (знаменитая задача о цепной линии) — сводились именно к дифференциальным уравнениям первого или второго порядка. Сегодня та же самая математическая машина, изначально созданная для описания падающих яблок и качающихся маятников, лежит в основе того, как мы формально описываем процесс обучения нейросети — и это одна из самых красивых иллюстраций того, насколько универсальна математика, если копнуть её достаточно глубоко.

Что такое дифференциальное уравнение первого порядка

Интуиция: правило скорости, а не правило значения

Давай разберёмся с самым базовым вопросом: чем дифференциальное уравнение принципиально отличается от обычного алгебраического? Алгебраическое уравнение вида $x^2-5x+6=0$ задаёт связь между числами — реши его, и получишь конкретные числовые корни. Дифференциальное уравнение задаёт связь между функцией $y(x)$ и её производной $y'(x)$ — и «решить» его значит найти не число, а целую функцию, которая делает это равенство тождеством при всех допустимых $x$.

Представь себе спидометр, о котором мы уже говорили во вступлении. Если тебе дана функция $v(t)$ — просто скорость в каждый момент, — то найти положение $s(t)$ элементарно: это обычное интегрирование, $s(t)=\int v(t)\,dt$. Но дифференциальное уравнение первого порядка — это ситуация посложнее: скорость сама зависит от положения. Например, при остывании кофе скорость остывания зависит от того, насколько кофе сейчас горячее окружающего воздуха: чем сильнее разница температур, тем быстрее идёт остывание. Записать это можно только через уравнение, связывающее саму функцию (температуру) и её производную (скорость изменения температуры) в один и тот же момент времени.

Определение

Определение. Дифференциальным уравнением первого порядка называется уравнение вида

$$F(x,y,y')=0$$

связывающее независимую переменную $x$, неизвестную функцию $y=y(x)$ и её первую производную $y'=\dfrac{dy}{dx}$. Если уравнение можно разрешить относительно производной, его записывают в так называемом нормальном виде:

$$y'=f(x,y)$$

Решением дифференциального уравнения на некотором промежутке называется функция $y=\varphi(x)$, которая при подстановке в уравнение обращает его в тождество для всех $x$ из этого промежутка. Порядок уравнения — это порядок наивысшей производной, входящей в уравнение: раз входит только $y'$ и не входит $y''$, $y'''$ и так далее, уравнение первого порядка.

Обрати внимание: слово «первого порядка» относится не к степени, в которой входит $y'$ (уравнение может быть нелинейным по $y'$, например содержать $(y')^2$, и всё равно оставаться первого порядка), а именно к тому, что наивысшая присутствующая производная — первая. Уравнение $y''+y=0$ — уже второго порядка, а $y'=y^2+x$ — по-прежнему первого, несмотря на квадрат самой функции $y$.

Разбор примеров

Пример 1 (лёгкий). Является ли функция $y=x^4$ решением уравнения $y'=4x^3$?

Находим производную функции $y=x^4$: $y'=4x^3$. Подставляем в уравнение: левая часть $y'=4x^3$, правая часть тоже $4x^3$ — тождество выполняется при всех $x$. Значит, $y=x^4$ — решение.

Ответ: да, является решением.

Пример 2 (средний). Проверить, что функция $y=Ce^x$ (при произвольной константе $C$) является решением уравнения $y'=y$, и понять, почему это уравнение описывает экспоненциальный рост числа просмотров видео.

Находим производную: $y'=Ce^x$ (константа $C$ при дифференцировании не меняется, а производная $e^x$ равна самой себе). Сравниваем с правой частью уравнения: правая часть — это просто $y=Ce^x$. Левая и правая часть совпадают при любом $C$ — значит, тождество выполняется, и $y=Ce^x$ — решение уравнения при любом значении константы $C$.

Содержательно уравнение $y'=y$ означает: «скорость роста числа просмотров в данный момент равна самому текущему числу просмотров». Это ровно модель вирусного роста — чем больше людей уже посмотрело видео, тем больше людей узнают о нём в следующую секунду и тем быстрее растёт аудитория. Ровно такая же математическая форма описывает и рост банковского вклада с непрерывно начисляемыми процентами, и размножение бактерий при неограниченных ресурсах.

Ответ: да, $y=Ce^x$ — решение уравнения $y'=y$ при любом $C$.

Пример 3 (сложный, машинное обучение). Функция потерь для одного веса модели задана как $L(w)=w^2$ (простейшая квадратичная «чаша»). Записать дифференциальное уравнение непрерывного градиентного спуска для этой функции потерь и проверить, что $w(t)=w_0e^{-2t}$ — его решение.

Сначала находим градиент: для $L(w)=w^2$ производная $\dfrac{dL}{dw}=2w$. Уравнение непрерывного градиентного спуска по определению — это $\dfrac{dw}{dt}=-\nabla L(w)=-2w$.

Проверяем, что $w(t)=w_0e^{-2t}$ — решение. Находим производную: $\dfrac{dw}{dt}=w_0\cdot(-2)e^{-2t}=-2w_0e^{-2t}=-2w(t)$. Сравниваем с правой частью уравнения $-2w$: совпадает при всех $t$.

Ответ: уравнение $\dfrac{dw}{dt}=-2w$, и $w(t)=w_0e^{-2t}$ действительно его решение. Обрати внимание на смысл: вес $w$, стартовавший из произвольной точки $w_0$, экспоненциально сходится к нулю — то есть к минимуму функции потерь. Это именно та идеальная, «бесконечно плавная» траектория, к которой стремится обычный дискретный градиентный спуск при устремлении шага обучения к нулю.

Почему это важно

Разница между алгебраическим и дифференциальным уравнением — это разница между «найти число» и «найти закон изменения». Именно поэтому дифференциальные уравнения — универсальный язык для описания динамики: роста популяций, остывания тел, движения тел под действием сил, распространения эпидемий и, как мы только что увидели, эволюции весов нейросети в процессе обучения. Как только ты научишься видеть в любой фразе вида «скорость изменения чего-либо зависит от текущего состояния» дифференциальное уравнение, перед тобой откроется единый инструмент для десятков, казалось бы, совершенно разных задач.

Общее и частное решение. Задача Коши

Интуиция: семья кривых и одна выбранная

Давай разберёмся, почему в примере выше решение $y=Ce^x$ содержало произвольную константу $C$, а не было единственной конкретной функцией. Представь себе не одну кривую, а целое семейство кривых — по одной кривой на каждое значение $C$. При $C=1$ получаешь одну экспоненту, при $C=5$ — другую, растянутую в пять раз по вертикали, при $C=-2$ — третью, перевёрнутую вниз. Все они удовлетворяют одному и тому же уравнению $y'=y$, потому что дифференциальное уравнение говорит только о скорости изменения, а не о конкретном стартовом значении. Чтобы выбрать из всей этой бесконечной семьи одну-единственную кривую, нужен дополнительный кусочек информации: где именно эта кривая начинается.

Аналогия из физики: зная только силу, действующую на тело, ты можешь восстановить не саму траекторию, а лишь то, как ускорение связано с положением. Чтобы получить конкретную траекторию конкретного тела, нужно ещё знать начальную скорость и начальное положение — без этого твой ответ будет содержать неопределённые константы.

Определение

Определение (общее и частное решение, задача Коши). Общим решением дифференциального уравнения первого порядка $y'=f(x,y)$ называется функция $y=\varphi(x,C)$, зависящая от одной произвольной постоянной $C$, которая при любом значении $C$ является решением уравнения (обычно требуется, чтобы при этом получалось всё множество решений, а не только его часть).

Частным решением называется решение, полученное из общего при конкретном фиксированном значении $C$.

Задачей Коши называется дифференциальное уравнение вместе с начальным условием вида $y(x_0)=y_0$, то есть требованием, чтобы искомая функция принимала заданное значение $y_0$ в заданной точке $x_0$. Решение задачи Коши — это частное решение, соответствующее тому единственному значению $C$, при котором выполняется начальное условие.

Геометрически общее решение — это целое семейство интегральных кривых на плоскости $(x,y)$, а начальное условие $y(x_0)=y_0$ — это требование, чтобы кривая прошла через конкретную точку $(x_0,y_0)$. При достаточно мягких условиях на функцию $f(x,y)$ (это гарантирует теорема существования и единственности, о которой мы ещё скажем пару слов в разделе про интересные факты) через каждую точку плоскости проходит ровно одна интегральная кривая — то есть задача Коши имеет ровно одно решение.

Разбор примеров

Пример 1 (лёгкий). Найти общее решение уравнения $y'=2x$, а затем частное решение, удовлетворяющее условию $y(0)=3$.

Общее решение находим прямым интегрированием обеих частей: $y=\int 2x\,dx=x^2+C$.

Теперь используем начальное условие: при $x=0$ должно быть $y=3$. Подставляем: $3=0^2+C=C$, значит $C=3$.

Ответ: общее решение $y=x^2+C$, частное решение задачи Коши — $y=x^2+3$.

Пример 2 (средний). Число просмотров видео растёт по закону $y'=ky$ (модель из предыдущего раздела), где $k=0{,}1$ — коэффициент вирусности. В начальный момент времени ($t=0$) видео набрало $y_0=1000$ просмотров. Найти частное решение — закон изменения числа просмотров во времени.

Общее решение уравнения $y'=ky$ уже разбиралось выше по структуре: аналогично $y'=y$, только с коэффициентом $k$ в показателе, $y(t)=Ce^{kt}$ (в этом легко убедиться проверкой: $y'=Ck\,e^{kt}=k\cdot Ce^{kt}=ky$).

Подставляем начальное условие $t=0$, $y=1000$: $1000=Ce^{0}=C\cdot1=C$, значит $C=1000$.

Ответ: частное решение $y(t)=1000\,e^{0{,}1t}$. Например, через $t=20$ единиц времени число просмотров составит $1000\,e^{2}\approx7389$ — почти в 7,4 раза больше исходного.

Пример 3 (сложный, машинное обучение). Для функции потерь $L(w)=aw^2$ (где $a>0$ — некоторый параметр кривизны) записать уравнение непрерывного градиентного спуска, найти его общее решение и частное решение при случайной инициализации весов $w(0)=w_0$. Определить, при каком значении $a$ сходимость к минимуму происходит быстрее.

Градиент: $\dfrac{dL}{dw}=2aw$. Уравнение непрерывного градиентного спуска: $\dfrac{dw}{dt}=-2aw$.

По аналогии с ранее разобранными примерами (структура уравнения $w'=-2aw$ та же самая, что $y'=ky$ с $k=-2a$), общее решение: $w(t)=Ce^{-2at}$.

Подставляем начальное условие $t=0$, $w=w_0$: $w_0=Ce^0=C$, значит $C=w_0$.

Ответ: частное решение $w(t)=w_0e^{-2at}$. Чем больше параметр кривизны $a$ (то есть чем «круче» функция потерь около минимума), тем больше показатель экспоненты $-2a$ и тем быстрее веса сходятся к нулю. Это ровно та интуиция, которая объясняет, почему при плохо обусловленной задаче оптимизации (когда кривизна по разным направлениям сильно различается) градиентный спуск сходится медленно по «пологим» направлениям и быстро по «крутым» — математически это разные значения эффективного параметра $a$ вдоль разных осей пространства весов.

Почему это важно

Различие между общим и частным решением — это не формальность, а отражение принципиальной неполноты одной лишь скорости изменения: зная только правило, по которому что-то меняется, невозможно узнать, откуда именно это «что-то» стартовало. Задача Коши — это способ добавить недостающую информацию и получить единственный, вполне конкретный ответ. В контексте машинного обучения это выглядит особенно наглядно: правило обновления весов (правая часть уравнения, то есть антиградиент функции потерь) одинаково для всех запусков обучения, а вот конкретная траектория обучения зависит от того, как именно были инициализированы веса в начальный момент — то есть от начального условия задачи Коши.

Уравнения с разделяющимися переменными

Интуиция: разводим x и y по разные стороны

Давай разберёмся с первым по-настоящему рабочим методом решения дифференциальных уравнений. Идея удивительно простая: если уравнение $y'=f(x,y)$ устроено так, что правую часть можно разложить на произведение функции только от $x$ и функции только от $y$, то всё уравнение можно буквально «развести по разные стороны» — всё, что зависит от $y$, включая сам дифференциал $dy$, перенести в левую часть, а всё, что зависит от $x$, — в правую. После этого остаётся проинтегрировать обе части по отдельности, и задача решена.

Представь, что $x$ и $y$ — это два человека, изначально перемешанные в одном уравнении, а метод разделения переменных — это способ рассадить их по разные стороны стола так, чтобы каждый остался при своих делах, а потом обработать каждого по отдельности (проинтегрировать). Это работает не всегда — правая часть должна быть именно произведением (или частным) функции от $x$ и функции от $y$, а не, скажем, их суммой, — но когда работает, это самый прямой путь к ответу.

Определение

Определение. Дифференциальное уравнение первого порядка называется уравнением с разделяющимися переменными, если его можно записать в виде

$$y'=g(x)\,h(y)$$

то есть правая часть представляет собой произведение функции, зависящей только от $x$, на функцию, зависящую только от $y$.

Метод решения. Записываем $y'=\dfrac{dy}{dx}$ и переписываем уравнение как $\dfrac{dy}{h(y)}=g(x)\,dx$ (это законно там, где $h(y)\neq0$). Интегрируем обе части независимо:

$$\int\frac{dy}{h(y)}=\int g(x)\,dx$$

Получившееся соотношение (обычно неявное, вида $H(y)=G(x)+C$) и есть общее решение уравнения. Отдельно нужно проверить, не теряются ли при делении на $h(y)$ особые (постоянные) решения вида $y=y_0$, где $h(y_0)=0$ — такие решения часто не выражаются через общую формулу ни при каком значении $C$.

Разбор примеров

Пример 1 (лёгкий). Решить уравнение $\dfrac{dy}{dx}=\dfrac{x}{y}$.

Переменные уже фактически разделены — переносим $y$ влево вместе с $dy$: $y\,dy=x\,dx$.

Интегрируем обе части: $\displaystyle\int y\,dy=\int x\,dx$, то есть $\dfrac{y^2}2=\dfrac{x^2}2+C_1$.

Умножаем на $2$ и переобозначаем константу: $y^2=x^2+C$ (где $C=2C_1$ — тоже произвольная постоянная, поскольку удвоение произвольной постоянной снова даёт произвольную постоянную).

Ответ: $y^2-x^2=C$ — семейство гипербол (при разных знаках $C$) и пары прямых $y=\pm x$ (при $C=0$).

Пример 2 (средний). Кофе остывает по закону Ньютона: скорость остывания пропорциональна разности между температурой кофе $T$ и температурой воздуха $T_0=20°C$, с коэффициентом $k=0{,}5$. В начальный момент кофе имел температуру $90°C$. Найти закон изменения температуры и определить, через сколько времени кофе остынет до $25°C$.

Уравнение: $\dfrac{dT}{dt}=-k(T-T_0)=-0{,}5(T-20)$. Разделяем переменные: $\dfrac{dT}{T-20}=-0{,}5\,dt$.

Интегрируем: $\ln|T-20|=-0{,}5t+C_1$, откуда $T-20=Ce^{-0{,}5t}$ (обозначив $C=\pm e^{C_1}$), то есть $T(t)=20+Ce^{-0{,}5t}$.

Подставляем начальное условие $T(0)=90$: $90=20+C$, значит $C=70$. Частное решение: $T(t)=20+70e^{-0{,}5t}$.

Находим время остывания до $25°C$: $20+70e^{-0{,}5t}=25\;\Rightarrow\;70e^{-0{,}5t}=5\;\Rightarrow\;e^{-0{,}5t}=\dfrac1{14}\;\Rightarrow\;-0{,}5t=-\ln14\;\Rightarrow\;t=2\ln14$.

Численно $\ln14\approx2{,}639$, значит $t\approx5{,}278$ единиц времени.

Ответ: $T(t)=20+70e^{-0{,}5t}$, время остывания до $25°C$ составляет $t=2\ln14\approx5{,}28$.

Пример 3 (сложный, машинное обучение). При определённых функциях потерь эффективная скорость изменения веса подчиняется логистическому уравнению $\dfrac{dw}{dt}=w(1-w)$ — такая форма встречается, например, при моделировании насыщения обучающегося параметра, который не может расти неограниченно, а стремится к некоторому предельному значению $1$. Найти частное решение при начальном условии $w(0)=0{,}1$ и исследовать поведение при $t\to\infty$.

Разделяем переменные: $\dfrac{dw}{w(1-w)}=dt$.

Раскладываем дробь на простейшие: $\dfrac1{w(1-w)}=\dfrac1w+\dfrac1{1-w}$ (проверка: $\dfrac1w+\dfrac1{1-w}=\dfrac{(1-w)+w}{w(1-w)}=\dfrac1{w(1-w)}$ — верно).

Интегрируем: $\displaystyle\int\left(\frac1w+\frac1{1-w}\right)dw=\int dt\;\Rightarrow\;\ln|w|-\ln|1-w|=t+C_1\;\Rightarrow\;\ln\left|\frac{w}{1-w}\right|=t+C_1$.

Потенцируем: $\dfrac{w}{1-w}=Ce^{t}$, где $C=\pm e^{C_1}$.

Подставляем $t=0$, $w=0{,}1$: $\dfrac{0{,}1}{0{,}9}=\dfrac19=C$.

Значит $\dfrac{w}{1-w}=\dfrac19e^t$, откуда $9w=(1-w)e^t\;\Rightarrow\;9w+we^t=e^t\;\Rightarrow\;w(9+e^t)=e^t\;\Rightarrow\;w(t)=\dfrac{e^t}{9+e^t}=\dfrac1{1+9e^{-t}}$.

Ответ: $w(t)=\dfrac1{1+9e^{-t}}$. При $t\to\infty$ слагаемое $9e^{-t}\to0$, значит $w(t)\to1$ — вес плавно насыщается, приближаясь к предельному значению $1$, но никогда его не достигая ровно (это классическая S-образная, сигмоидальная кривая). Такая динамика характерна для процессов с естественным «потолком»: аудитория соцсети не может расти быстрее числа живых людей на планете, а некоторые внутренние параметры моделей ограничены сверху самой архитектурой (например, значения после сигмоиды).

Почему это важно

Метод разделения переменных — это рабочая лошадка среди всех методов решения дифференциальных уравнений: он прямой, механический и не требует никаких хитрых догадок, если только уравнение действительно можно представить в нужной форме. Именно поэтому с него начинают изучение дифференциальных уравнений и к нему сводят многие более сложные уравнения через замену переменных — в точности как мы сейчас сделаем с однородными уравнениями.

Однородные уравнения первого порядка

Интуиция: когда важна не сама точка, а направление от начала координат

Давай разберёмся, что делать, когда правая часть $y'=f(x,y)$ не раскладывается в произведение функции от $x$ на функцию от $y$, и метод разделения переменных напрямую не работает. Оказывается, есть широкий класс уравнений, которые можно свести к разделяющимся с помощью одной удачной замены. Речь идёт о ситуации, когда правая часть зависит не от $x$ и $y$ по отдельности, а только от их отношения $y/x$.

Представь себе точку на плоскости и луч, проведённый из начала координат через эту точку. Отношение $y/x$ — это ровно тангенс угла наклона этого луча. Если правая часть уравнения зависит только от этого отношения, значит наклон касательной к решению в каждой точке зависит не от того, «далеко» или «близко» эта точка от начала координат, а только от того, «в каком направлении» она лежит. Это и есть геометрический смысл однородности: картина поля направлений одинаково выглядит вдоль любого луча из начала координат, просто растянутая или сжатая.

Определение

Определение. Уравнение $y'=f(x,y)$ называется однородным, если его правую часть можно представить в виде функции одного отношения:

$$y'=\varphi\!\left(\frac{y}{x}\right)$$

Метод решения. Вводим новую неизвестную функцию $v(x)=\dfrac{y}{x}$, то есть $y=vx$. По правилу дифференцирования произведения $y'=v+xv'$. Подставляя в исходное уравнение, получаем:

$$v+xv'=\varphi(v)\quad\Longrightarrow\quad xv'=\varphi(v)-v\quad\Longrightarrow\quad \frac{dv}{\varphi(v)-v}=\frac{dx}{x}$$

Это уже уравнение с разделяющимися переменными относительно $v$ и $x$ — решаем его стандартным методом из предыдущего раздела, а затем возвращаемся к исходной функции по формуле $y=vx$.

Ключевой момент, за которым нужно следить: замена $y=vx$ автоматически превращает любое однородное уравнение в разделяющееся, потому что после подстановки переменная $x$ сама «выпадает» из правой части, оставляя чистое уравнение на $v$ и $x$ в разделяемой форме — это не совпадение, а прямое следствие того, что $\varphi(v)-v$ зависит только от $v$.

Разбор примеров

Пример 1 (лёгкий). Решить однородное уравнение $xy'=x+y$.

Приводим к нормальному виду: $y'=1+\dfrac{y}{x}$ — это уже функция одного отношения $y/x$, значит уравнение однородное.

Делаем замену $y=vx$, $y'=v+xv'$: $v+xv'=1+v\;\Rightarrow\;xv'=1$.

Разделяем переменные: $dv=\dfrac{dx}{x}$, интегрируем: $v=\ln|x|+C$.

Возвращаемся к $y$: $y=vx=x\bigl(\ln|x|+C\bigr)$.

Проверка подстановкой: $y'=(\ln|x|+C)+x\cdot\dfrac1x=\ln|x|+C+1$. Правая часть исходного уравнения $1+y/x=1+(\ln|x|+C)$. Оба выражения равны $1+\ln|x|+C$ — тождество выполняется.

Ответ: $y=x(\ln|x|+C)$.

Пример 2 (средний). Решить однородное уравнение $y'=\dfrac{x+y}{x-y}$.

Делим числитель и знаменатель на $x$: $y'=\dfrac{1+v}{1-v}$, где $v=y/x$ — правая часть зависит только от отношения, уравнение однородное.

Подставляем $y'=v+xv'$: $v+xv'=\dfrac{1+v}{1-v}\;\Rightarrow\;xv'=\dfrac{1+v}{1-v}-v=\dfrac{(1+v)-v(1-v)}{1-v}=\dfrac{1+v^2}{1-v}$.

Разделяем переменные: $\dfrac{1-v}{1+v^2}\,dv=\dfrac{dx}{x}$. Раскладываем левую часть на два табличных интеграла: $\dfrac{1-v}{1+v^2}=\dfrac1{1+v^2}-\dfrac{v}{1+v^2}$.

Интегрируем: $\arctan v-\dfrac12\ln(1+v^2)=\ln|x|+C_1$.

Соберём логарифмы вместе: $\dfrac12\ln(1+v^2)+\ln|x|=\dfrac12\ln(1+v^2)+\dfrac12\ln x^2=\dfrac12\ln\bigl(x^2(1+v^2)\bigr)=\dfrac12\ln(x^2+y^2)$ (использовали, что $x^2v^2=y^2$). Значит уравнение переписывается как:

$$\arctan\frac{y}{x}-\frac12\ln(x^2+y^2)=C$$

Ответ: $\arctan\dfrac{y}{x}-\dfrac12\ln(x^2+y^2)=C$. Любопытный факт: если перейти к полярным координатам $x=r\cos\theta$, $y=r\sin\theta$ (тогда $y/x=\tan\theta$ и $x^2+y^2=r^2$), уравнение превращается в $\theta-\ln r=C$, то есть $r=Ae^{\theta}$ — это в точности уравнение логарифмической спирали. Однородные уравнения такого типа систематически порождают именно спиральные семейства решений.

Пример 3 (сложный, машинное обучение). Пусть отношение скоростей изменения двух весов модели $w_1$ и $w_2$ в процессе оптимизации подчиняется однородному закону $\dfrac{dw_2}{dw_1}=\dfrac{w_2}{w_1}+1$ (одна координата «тянет» другую пропорционально их текущему отношению плюс постоянный снос). Найти траекторию $w_2(w_1)$ в пространстве весов при начальном условии $w_1=1$, $w_2=0$ — то есть оптимизация стартует с оси $w_1$.

Это уравнение по структуре идентично примеру 1 этого раздела (только переменные названы $w_1$ вместо $x$ и $w_2$ вместо $y$): $\dfrac{dw_2}{dw_1}=1+\dfrac{w_2}{w_1}$.

По аналогии с примером 1, общее решение: $w_2=w_1\bigl(\ln|w_1|+C\bigr)$.

Подставляем начальное условие $w_1=1$, $w_2=0$: $0=1\cdot(\ln1+C)=0+C$, значит $C=0$.

Ответ: $w_2=w_1\ln|w_1|$. Траектория весов стартует из точки $(1,0)$ и дальше идёт по кривой $w_2=w_1\ln w_1$ (для $w_1>0$) — заметь, что вблизи $w_1=1$ функция $\ln w_1$ близка к нулю, поэтому траектория сначала почти не отклоняется от оси $w_1$, а затем, по мере роста $w_1$, всё сильнее уходит вверх. Такое поведение типично для оптимизационных траекторий с обратной связью между координатами: небольшое начальное отклонение усиливается со временем, если правая часть уравнения устроена так, что «подталкивает» отклонение дальше от нуля.

Почему это важно

Однородные уравнения — это наглядный пример того, как удачная замена переменной превращает уравнение, которое на первый взгляд совершенно не поддаётся прямому разделению переменных, в уравнение, которое поддаётся. Это общий математический приём, который ты ещё не раз встретишь: не умеешь решить уравнение в исходных переменных — попробуй заменить переменные так, чтобы структура упростилась. В следующем уроке про линейные уравнения ты увидишь похожий по духу приём — интегрирующий множитель, — а сама идея замены переменных для упрощения дифференциального уравнения — один из центральных мотивов всей теории.

Поле направлений: геометрический смысл уравнения

Интуиция: карта маленьких стрелочек

Давай разберёмся, как читать дифференциальное уравнение чисто геометрически, вообще не решая его аналитически. Уравнение $y'=f(x,y)$ утверждает: в каждой точке плоскости $(x,y)$, через которую может пройти решение, наклон касательной к этому решению равен значению $f(x,y)$ в этой самой точке. А значит, если ты возьмёшь функцию $f(x,y)$ и в каждой точке плоскости нарисуешь маленький отрезок с наклоном, равным $f(x,y)$ в этой точке, у тебя получится картина — поле направлений, — которая как бы «намекает», куда должна повернуть интегральная кривая, если она проходит через эту точку.

Представь себе компас на каждой точке карты, который всегда указывает не на север, а в направлении, заданном правилом $f(x,y)$. Решение дифференциального уравнения — это маршрут, который в каждой точке следует показаниям локального компаса. Пройди мысленно по этим стрелочкам, соединяя их в непрерывную линию, — и ты получишь интегральную кривую, даже не написав ни одной формулы. Именно так до появления компьютеров математики и инженеры приближённо решали дифференциальные уравнения — буквально рисуя поле направлений на бумаге и прослеживая по нему линии.

Определение

Определение (поле направлений). Полем направлений дифференциального уравнения $y'=f(x,y)$ называется совокупность коротких отрезков (направлений), проведённых в узлах некоторой сетки точек плоскости, каждый из которых имеет угловой коэффициент, равный значению $f(x,y)$ в соответствующей точке. Интегральная кривая — это кривая, которая в каждой своей точке касается направления поля, заданного в этой точке.

Изоклиной называется линия, вдоль которой наклон поля направлений постоянен, то есть множество точек, удовлетворяющих уравнению $f(x,y)=k$ при фиксированном $k$. Изоклины — удобный практический инструмент для быстрого построения приближённой картины поля направлений: вдоль каждой изоклины все отрезки поля параллельны друг другу и имеют один и тот же наклон $k$.

Стоит отдельно подчеркнуть: изоклина сама по себе, вообще говоря, не является интегральной кривой — это просто вспомогательная линия, вдоль которой удобно рисовать параллельные отрезки одинакового наклона. Интегральные кривые пересекают изоклины (кроме особых случаев, когда изоклина сама оказывается решением).

Разбор примеров

Пример 1 (лёгкий). Построить несколько изоклин для уравнения $y'=x$ и определить форму семейства интегральных кривых.

Изоклина для наклона $k$ задаётся уравнением $x=k$ — это вертикальная прямая. Значит, вдоль любой вертикальной прямой $x=k$ все отрезки поля направлений имеют один и тот же наклон, равный $k$ (чем правее вертикальная линия, тем круче наклон отрезков; при $x=0$ наклон нулевой, отрезки горизонтальны).

Решая уравнение напрямую (простое интегрирование): $y=\int x\,dx=\dfrac{x^2}2+C$ — семейство парабол.

Ответ: изоклины — вертикальные прямые $x=k$; интегральные кривые — параболы $y=\dfrac{x^2}2+C$, у каждой из которых вершина лежит на оси $y$ (в точке минимума наклон равен нулю, что как раз соответствует изоклине $x=0$).

Пример 2 (средний). Исследовать поле направлений уравнения $y'=x-y$ через изоклины и определить особое поведение решений при больших $x$.

Изоклина для наклона $k$: $x-y=k$, то есть $y=x-k$ — это семейство параллельных прямых с угловым коэффициентом $1$. В частности, изоклина нулевого наклона ($k=0$) — это прямая $y=x$: вдоль неё поле направлений горизонтально.

Особенно интересна изоклина $k=1$: прямая $y=x-1$. Проверим, не является ли она сама интегральной кривой: на ней $y'=1$ по определению уравнения (наклон совпадает с $k=1$), и производная самой прямой $y=x-1$ тоже равна $1$ — совпадение неслучайно, это означает, что прямая $y=x-1$ сама является одним из решений уравнения.

Ответ: прямая $y=x-1$ — частное решение уравнения $y'=x-y$ (это легко проверить и напрямую: если $y=x-1$, то $y'=1$, а правая часть $x-y=x-(x-1)=1$ — совпадает). Как мы увидим в разделе с практикой (задание 21), все остальные интегральные кривые при $x\to\infty$ неограниченно приближаются к этой прямой — она выступает своеобразным «руслом», к которому стягивается всё поле направлений.

Пример 3 (сложный, машинное обучение). Функция потерь двух весов задана как $L(w_1,w_2)=w_1^2+w_2^2$ (простая параболоидная «чаша» с минимумом в начале координат). Уравнение непрерывного градиентного спуска — это система $\dfrac{dw_1}{dt}=-2w_1$, $\dfrac{dw_2}{dt}=-2w_2$, но если рассматривать зависимость $w_2$ от $w_1$ вдоль траектории, получаем $\dfrac{dw_2}{dw_1}=\dfrac{w_2}{w_1}$ (отношение скоростей). Опиши поле направлений этого уравнения без решения и укажи, куда указывают стрелки в произвольной точке $(w_1,w_2)\neq(0,0)$.

Наклон поля направлений в точке $(w_1,w_2)$ равен $\dfrac{w_2}{w_1}$ — это ровно тангенс угла между лучом из начала координат к точке $(w_1,w_2)$ и осью $w_1$. Значит, в каждой точке стрелка поля направлений лежит вдоль луча, соединяющего эту точку с началом координат — то есть вдоль прямой, проходящей через минимум функции потерь.

Это в точности отражает содержательный факт: при симметричной «круглой» функции потерь $w_1^2+w_2^2$ градиентный спуск движется по прямой линии прямо к минимуму, не отклоняясь в сторону — каждая стрелка поля направлений указывает точно в направлении начала координат (или от него), а значит и сама траектория оптимизации, стартовав из любой точки, идёт по прямой линии к минимуму.

Ответ: поле направлений в каждой точке $(w_1,w_2)$ ориентировано вдоль прямой, соединяющей эту точку с началом координат $(0,0)$ — минимумом функции потерь; соответствующие интегральные кривые — это в точности семейство прямых, проходящих через начало координат, $w_2=Cw_1$ (в чём легко убедиться и прямым интегрированием: $\dfrac{dw_2}{w_2}=\dfrac{dw_1}{w_1}\;\Rightarrow\;\ln|w_2|=\ln|w_1|+C_1\;\Rightarrow\;w_2=Cw_1$).

Почему это важно

Поле направлений — это способ увидеть дифференциальное уравнение целиком, одним взглядом, даже не умея решить его аналитически. Многие уравнения, встречающиеся на практике (включая почти все реалистичные модели градиентного спуска для сложных функций потерь), вообще не решаются в элементарных функциях — и единственный способ понять их поведение состоит именно в анализе поля направлений и, как правило, в его последующей численной обработке на компьютере. Умение мысленно «читать» наклон касательной по правой части уравнения — это тот геометрический навык, который останется полезным даже тогда, когда аналитическое решение окажется недостижимым.

Практика: 30 заданий

Базовые задания (1–10)

Задание 1: Найти общее решение уравнения $y'=4x^3$.


Задание 2: Решить задачу Коши: $y'=2x$, $y(0)=3$.


Задание 3: Найти общее решение уравнения $y'=y$ методом разделения переменных.


Задание 4: Решить задачу Коши: $y'=-2y$, $y(0)=5$.


Задание 5: Найти общее решение уравнения $xy'=y$.


Задание 6: Найти общее решение уравнения $y'=\dfrac{x}{y}$.


Задание 7: Проверить, что $y=Ce^{x^2}$ — общее решение уравнения $y'=2xy$.


Задание 8: Найти общее решение уравнения $y'=3y^2$.


Задание 9: Кофе остывает по закону $\dfrac{dT}{dt}=-0{,}5(T-20)$, $T(0)=90$. Найти частное решение (это та же модель, что и в теоретическом разделе, — реши её самостоятельно).


Задание 10: Найти общее решение уравнения $xy'-y=0$ и определить порядок этого уравнения.


Средние задания (11–20)

Задание 11: Решить однородное уравнение $y'=\dfrac{x+y}{x}$.


Задание 12: Решить однородное уравнение $y'=\dfrac{x+y}{x-y}$.


Задание 13 (машинное обучение): Непрерывный градиентный спуск $\dfrac{dw}{dt}=-4w$, $w(0)=2$. Найти $w(t)$ и время, за которое вес уменьшится до значения $0{,}01$.


Задание 14: Решить задачу Коши $xy'=y+x$, $y(1)=3$.


Задание 15: Решить однородное уравнение $y'=\dfrac{y}{x}+\dfrac{x}{y}$.


Задание 16: Используя частное решение из задания 9 ($T(t)=20+70e^{-0{,}5t}$), найти время остывания кофе до $25°C$.


Задание 17: Решить задачу Коши $xy'=2y$, $y(1)=3$.


Задание 18: Решить уравнение $y'=e^{x-y}$.


Задание 19 (машинное обучение): Решить логистическое уравнение насыщения $\dfrac{dw}{dt}=w(1-w)$, $w(0)=0{,}1$ (задача идентична разобранной в теоретическом разделе — реши её самостоятельно и укажи предел при $t\to\infty$).


Задание 20: Решить однородное уравнение $(x^2+y^2)\,dx-2xy\,dy=0$.


Продвинутые задания (21–30)

Задание 21: Решить уравнение $y'=x-y$ с помощью замены $z=x-y$ и определить, к какой прямой стремятся все решения при $x\to\infty$.


Задание 22: Решить уравнение $(1+x^2)y'=xy$.


Задание 23: Решить однородное уравнение $y'=\dfrac{y^2+2xy}{x^2}$.


Задание 24: Решить задачу Коши для однородного уравнения $y'=\dfrac{y}{x}-\dfrac{x}{y}$, $y(1)=2$.


Задание 25 (машинное обучение): Для функции потерь $L(w)=\dfrac{w^4}4$ непрерывный градиентный спуск задаётся уравнением $\dfrac{dw}{dt}=-w^3$, $w(0)=w_0$. Найти $w(t)$ и сравнить скорость сходимости к нулю с экспоненциальной (как в задаче для квадратичной функции потерь).


Задание 26: Решить однородное уравнение $xy'=\dfrac{y^2}{x}$.


Задание 27: Решить уравнение $y'\cos x=y\ln y$.


Задание 28: Решить однородное уравнение $xy'=y+\sqrt{x^2+y^2}$ (при $x>0$).


Задание 29 (машинное обучение): Скорость обучения убывает по расписанию $\eta(t)=\dfrac{\eta_0}{1+t}$, и вес меняется по закону $\dfrac{dw}{dt}=-\eta(t)\,w$, $w(0)=w_0$. Найти $w(t)$ и сравнить с убыванием при постоянной скорости обучения.


Задание 30 (машинное обучение): Отношение скоростей изменения двух весов подчиняется уравнению $\dfrac{dw_2}{dw_1}=\dfrac{w_2}{w_1}+1$ (то же уравнение, что и в теоретическом разделе про однородные уравнения). Найти траекторию при начальном условии $w_1=1$, $w_2=0$.


Частые ошибки

Давай разберём, на чём чаще всего спотыкаются при первом знакомстве с дифференциальными уравнениями — эти ошибки встречаются настолько регулярно, что их стоит знать заранее, чтобы не наступать на те же грабли.

  • Ошибка: забывают о том, что при разделении переменных под логарифмом обязательно должен стоять модуль. Вместо $\ln|y|=\ln|x|+C$ пишут $\ln y=\ln x+C$, теряя из виду отрицательные значения $y$ и $x$, для которых логарифм самого числа не определён.

    Правильно: всегда пиши $\ln|y|$, а не $\ln y$, пока явно не известно, что $y$ сохраняет знак на рассматриваемом промежутке.

  • Ошибка: при делении обеих частей уравнения на функцию (например, на $y$ при переходе от $xy'=y$ к $y'/y=1/x$) забывают проверить случай, когда эта функция равна нулю, — и теряют особое решение.

    Правильно: для уравнения $xy'=y$ помимо семейства $y=Cx$ отдельно стоит заметить, что $y\equiv0$ тоже является решением (оно, впрочем, получается из общей формулы при $C=0$, но в более общих случаях особое решение может вообще не входить ни в какое значение константы).

  • Ошибка: в однородных уравнениях забывают правило дифференцирования произведения при замене $y=vx$ и пишут $y'=v'$ вместо правильного $y'=v+xv'$.

    Правильно: $y=vx$ — это произведение двух функций от $x$ ($v(x)$ и $x$), поэтому производная берётся по правилу произведения: $y'=v'\cdot x+v\cdot1=v+xv'$.

  • Ошибка: путают общее и частное решение — считают, что «решили уравнение» означает нашли одну конкретную функцию, а не всё семейство функций с параметром $C$.

    Правильно: сначала всегда находи общее решение с произвольной постоянной, и лишь затем, если задано начальное условие, вычисляй конкретное значение этой постоянной.

  • Ошибка: при подстановке начального условия в общее решение неправильно обращаются со знаком константы, которая появилась после потенцирования (например, из $\ln|y|=kx+C_1$ переходят к $y=e^{kx}+C_1$ вместо правильного $y=Ce^{kx}$, где $C=\pm e^{C_1}$).

    Правильно: после потенцирования произвольная постоянная выходит как множитель перед экспонентой, а не как слагаемое, — это одна из самых частых технических ошибок при разделении переменных.

  • Ошибка: путают порядок уравнения со степенью, в которой входит производная, — считают, что уравнение $(y')^2=x$ имеет «второй порядок», потому что производная возведена в квадрат.

    Правильно: порядок определяется исключительно тем, какая по счёту производная является наивысшей во всём уравнении; $(y')^2=x$ содержит только первую производную (пусть и в квадрате), значит это по-прежнему уравнение первого порядка.

Главное запомнить

  • Дифференциальное уравнение первого порядка $y'=f(x,y)$ связывает независимую переменную, неизвестную функцию и её первую производную — решить его значит найти саму функцию, а не число.

  • Общее решение содержит одну произвольную постоянную $C$ и описывает целое семейство интегральных кривых (или траекторий, если переменная — время).

  • Частное решение получается из общего фиксацией конкретного значения $C$; задача Коши — это уравнение с начальным условием $y(x_0)=y_0$, которое выбирает единственную кривую из семейства.

  • Уравнение с разделяющимися переменными приводится к виду $f(y)\,dy=g(x)\,dx$ и решается прямым интегрированием обеих частей по отдельности.

  • Однородное уравнение — это уравнение, правая часть которого зависит только от отношения $y/x$; замена $y=vx$ (с обязательным правилом $y'=v+xv'$) сводит его к разделяющемуся.

  • Геометрически уравнение $y'=f(x,y)$ задаёт поле направлений: в каждой точке плоскости наклон касательной к решению равен значению $f$ в этой точке, а изоклины — это линии постоянного наклона поля.

  • При делении на выражение, которое может обращаться в ноль (при разделении переменных или в однородных уравнениях), всегда проверяй, не теряешь ли ты особое постоянное решение.

  • Непрерывный градиентный спуск $\dfrac{dw}{dt}=-\nabla L(w)$ — это дифференциальное уравнение первого порядка, и его решение описывает идеальную, «бесконечно плавную» траекторию обучения при устремлении шага обучения к нулю.

  • Скорость сходимости непрерывного градиентного спуска к минимуму напрямую зависит от формы функции потерь: для квадратичных функций получается экспоненциальное убывание, для более пологих (например, четвёртой степени) — только степенное.

  • Архитектура Neural ODE заменяет дискретные слои сети непрерывной эволюцией скрытого состояния, заданной дифференциальным уравнением, правая часть которого сама является нейросетью.

Связь с другими темами курса

Этот урок опирается на технику интегрирования и понятие производной, которые ты отрабатывал на протяжении всего курса математического анализа, а непосредственно предшествующий урок про формулу Стокса (урок 222) завершил большой блок интегрального исчисления функций нескольких переменных — теперь мы возвращаемся к более элементарной, но не менее богатой теме уравнений, связывающих функцию одной переменной с её производной.

Дальше эта тема раскрывается сразу в нескольких направлениях. В следующем уроке (224) ты познакомишься с линейными дифференциальными уравнениями первого порядка и методом интегрирующего множителя — это ещё один способ свести неразделяющееся уравнение к решаемому виду, во многом похожий по духу на замену $y=vx$ для однородных уравнений. Далее курс приведёт тебя к дифференциальным уравнениям высших порядков (где кроме $y'$ фигурируют $y''$, $y'''$ и так далее — например, уравнения колебаний), к системам дифференциальных уравнений (когда друг с другом связаны сразу несколько неизвестных функций — именно такой аппарат используется для описания одновременной эволюции всех весов нейросети сразу), а также к численным методам решения (метод Эйлера, методы Рунге-Кутты), которые становятся необходимы, как только аналитическое решение уравнения через элементарные функции оказывается недостижимым — а для реалистичных функций потерь это правило, а не исключение.

Интересные факты

  • Neural ODE. В 2018 году вышла статья «Neural Ordinary Differential Equations» (дословно «Нейросетевые обыкновенные дифференциальные уравнения»), получившая награду лучшей работы конференции NeurIPS. Идея авторов: вместо дискретной последовательности слоёв $h_{n+1}=h_n+f(h_n,\theta_n)$, как в архитектуре ResNet, использовать непрерывную эволюцию скрытого состояния $\dfrac{dh}{dt}=f(h(t),t,\theta)$, где правая часть $f$ — обучаемая нейросеть. «Глубина» такой сети измеряется не числом слоёв, а временем интегрирования дифференциального уравнения, а сам процесс прямого прохода через сеть превращается в решение задачи Коши для этого уравнения.

  • Логистическое уравнение и его универсальность. Уравнение $\dfrac{dw}{dt}=w(1-w)$, которое ты решал в задании 19, впервые было предложено бельгийским математиком Пьером Ферхюльстом в 1838 году для моделирования роста населения с ограниченными ресурсами. Ровно та же самая математическая форма сегодня описывает и распространение эпидемий, и насыщение аудитории соцсети, и поведение некоторых параметров при обучении моделей — универсальность одного и того же уравнения в совершенно разных предметных областях является одной из самых показательных иллюстраций силы математической абстракции.

  • Теорема существования и единственности. В общем случае дифференциальное уравнение $y'=f(x,y)$ гарантированно имеет единственное решение задачи Коши только при достаточно «хороших» условиях на функцию $f$ (например, непрерывность вместе с условием Липшица по $y$) — это утверждение называется теоремой Пикара-Линделёфа. Похожая логика лежит в основе доказательств сходимости некоторых оптимизационных алгоритмов: гарантия того, что градиентный спуск сойдётся к единственной точке, часто опирается на аналогичные условия гладкости функции потерь.

  • Метод изоклин до эры компьютеров. До появления численных методов на компьютере инженеры и физики строили приближённые решения дифференциальных уравнений буквально вручную — рисовали на бумаге сетку изоклин, а затем прочерчивали интегральную кривую, следуя направлению маленьких отрезков поля направлений. Тот же принцип — «двигаться небольшими шагами вдоль локального направления» — лежит в основе метода Эйлера, простейшего численного метода решения дифференциальных уравнений, который по своей идее удивительно близок именно к обычному дискретному градиентному спуску.

  • Задача о цепной линии. Форма провисающего под собственным весом гибкого троса или цепи (так называемая цепная линия, или катенарий) была одной из первых задач, для решения которой в конце XVII века потребовалось составить и решить дифференциальное уравнение — задачу решили независимо Лейбниц, Гюйгенс и Иоганн Бернулли в 1691 году. Любопытно, что форма подвесных мостов и арок нередко проектируется именно по катенарию, потому что такая форма распределяет нагрузку максимально равномерно.

Лайфхаки и полезные трюки

  • Увидел уравнение вида $y'=\varphi(y/x)$ — сразу распознавай однородное уравнение и не пытайся разделить переменные напрямую: сначала сделай замену $y=vx$, и только потом разделяй переменные относительно $v$ и $x$.

  • Если после разделения переменных получилась дробь вида $\dfrac1{y(1-y)}$ или $\dfrac1{v(v+1)}$ — сразу вспоминай про разложение на простые дроби: почти всегда это быстрее и надёжнее, чем пытаться угадать первообразную напрямую.

  • Уравнение вида $y'=f(ax+by+c)$, где правая часть зависит не от $x$ и $y$ по отдельности, а от их линейной комбинации, сводится к разделяющемуся заменой $z=ax+by+c$ — именно так решалось задание 21 этого урока.

  • Всегда проверяй найденное решение прямой подстановкой обратно в исходное уравнение — это занимает секунды, зато сразу ловит арифметические ошибки, допущенные при интегрировании.

  • В задаче Коши сначала до конца доводи общее решение с буквой $C$, и только потом подставляй начальное условие — попытка «угадать» константу заранее почти всегда приводит к путанице.

  • Перед тем как решать уравнение аналитически, набросай на бумаге поле направлений хотя бы в пяти-шести точках — часто уже по этому грубому эскизу видно, растут решения или убывают, стремятся ли они к какой-то прямой или расходятся, и это сразу подсказывает, чего ожидать от финального ответа.

  • Если после разделения переменных ты делишь на выражение, которое может равняться нулю (например, на $y$, на $1-v$, на $v(v+1)$), всегда отдельно выпиши и проверь соответствующие постоянные значения — иногда это готовое решение, которое не выражается через общую формулу ни при каком $C$.

Дифференциальные уравнения первого порядка — это, по сути, первый настоящий язык динамики, который ты осваиваешь в математическом анализе: язык, на котором можно строго сформулировать буквально любой процесс, где скорость изменения зависит от текущего состояния. Ты научился видеть разницу между общим семейством решений и единственной выбранной кривой, освоил два конкретных рабочих метода — разделение переменных и замену для однородных уравнений — и научился читать уравнение геометрически через поле направлений, даже когда аналитическое решение недостижимо. Помни, что именно этот аппарат — в чистом виде, без всяких упрощений — лежит в основе того, как мы формально описываем непрерывный градиентный спуск и архитектуры вроде Neural ODE: то самое уравнение $dw/dt=-\nabla L(w)$, с которого мы начали урок, теперь для тебя не абстрактная формула, а конкретный, полностью понятный тип дифференциального уравнения, который ты уже умеешь анализировать. Дальше — линейные уравнения и интегрирующий множитель, а твой инструментарий продолжит расти.

Понял тему? Закрепи в боте! 🚀

Попрактикуйся на задачах и получи персональные рекомендации от AI

💪 Начать тренировку
💬 Есть вопрос? Спроси бота!