🔴 Сложный ⏱️ 55 минут

Формула Тейлора

📋 Содержание урока

Формула Тейлора 🧮

Представь, что тебе нужно приближённо вычислить $\sqrt{4{,}01}$ или $\sin(0{,}2)$ без калькулятора — или, ещё ближе к делу, что оптимизатор внутри нейросети должен на каждом шаге быстро понять, куда двигаться дальше, зная в текущей точке только значение функции потерь, её градиент и вторую производную (гессиан). В обоих случаях ты сталкиваешься с одной и той же задачей: сложную, «неудобную» функцию хочется на время подменить простым многочленом, который в окрестности нужной точки ведёт себя почти неотличимо от оригинала, но с которым куда проще работать — складывать, умножать, дифференцировать, решать уравнения.

Формула Тейлора — это точный, строго доказанный ответ на вопрос «а насколько хорошо многочлен приближает функцию и как оценить ошибку такого приближения». Идея на удивление проста: если функция гладкая (имеет достаточно много производных) в окрестности точки $a$, то она раскладывается в сумму слагаемых вида $\frac{f^{(k)}(a)}{k!}(x-a)^k$ — многочлен Тейлора — плюс остаток, который стремится к нулю быстрее, чем последнее взятое слагаемое. Это не эвристика и не приближённое равенство «на глазок»: у остатка есть точная формула, которая позволяет заранее гарантировать, что ошибка приближения не превысит нужного тебе порога.

Ты уже встречал частный случай этой идеи в предыдущем уроке, даже не заметив этого явно: теорема Лагранжа о конечных приращениях, $f(x)-f(a)=f'(c)(x-a)$, — это в точности формула Тейлора нулевого порядка, где от функции берётся только линейное приближение и точный остаток первого порядка. Формула Тейлора обобщает эту идею на произвольный порядок: добавляя квадратичный член, кубический и так далее, ты получаешь всё более точное приближение, а формула остатка честно говорит, насколько именно ты ошибаешься на каждом шаге.

Именно эта логика лежит в основе метода Ньютона второго порядка в оптимизации — одного из самых мощных инструментов машинного обучения там, где градиентного спуска недостаточно. Метод Ньютона не довольствуется линейным приближением функции потерь (как обычный градиентный спуск), а строит квадратичную аппроксимацию через формулу Тейлора: значение функции, градиент и гессиан в текущей точке. Эта квадратичная «модель» функции потерь имеет явный минимум, который можно вычислить одним шагом — и это ядро того, почему методы второго порядка сходятся быстрее, чем линейные. Дальше в этом уроке ты увидишь этот вывод во всех деталях, а заодно поймёшь, почему функции активации вроде GELU строятся именно через полиномиальные приближения гладких, но «неудобных» для вычислений функций.

История: откуда это взялось?

Формула носит имя английского математика Брука Тейлора (1685–1731), который опубликовал её в 1715 году в трактате Methodus incrementorum directa et inversa («Прямой и обратный метод приращений»). Тейлор был учеником традиции Ньютона, членом Королевского общества и, помимо анализа, занимался теорией перспективы в живописи и физикой колебаний струны. Формулировка, которую он дал, была чисто алгебраической — он вывел ряд как бесконечную сумму, опираясь на метод конечных разностей Ньютона, доведённый до предельного перехода. Строгого понятия остаточного члена, сходимости или условий применимости в современном смысле у Тейлора не было: для математики начала XVIII века такие вопросы просто ещё не ставились в явном виде — само понятие предела оставалось интуитивным ещё много десятилетий.

Отдельная историческая деталь, которая часто удивляет: важнейший частный случай формулы, при $a=0$, в учебниках называют формулой Маклорена — по имени шотландского математика Колина Маклорена (1698–1746), вундеркинда, ставшего профессором в 19 лет и написавшего в 1742 году фундаментальный труд A Treatise of Fluxions. Но сам Маклорен в этой книге честно указывал, что разложение при $a=0$ было известно ещё до него — в том числе Джеймсу Грегори и самому Тейлору. Тем не менее имя закрепилось именно за Маклореном, отчасти потому что его труд был особенно подробным и педагогически влиятельным, широко использовавшимся для обучения студентов на протяжении столетия. Так в математике часто бывает: название закрепляется не строго за первооткрывателем, а за тем, чья формулировка оказалась наиболее востребованной и хорошо изложенной.

Строгая версия формулы — с явным остаточным членом, точной оценкой погрешности и условиями сходимости — появилась значительно позже, в эпоху «арифметизации анализа» конца XVIII — начала XIX века. Остаточный член в форме, которую ты изучишь в этом уроке, связывают с именем Жозефа Луи Лагранжа, который в 1790-х годах впервые дал строгую оценку разности между функцией и её многочленом Тейлора через производную более высокого порядка в некоторой промежуточной точке — используя логику, очень похожую на ту, что ты уже видел в теореме Лагранжа о среднем значении. Именно поэтому эта форма остатка и называется «форма Лагранжа»: она не только исторически связана с его именем, но и по сути представляет собой прямое обобщение той же самой теоремы.

Вывод формулы Тейлора как обобщение теоремы Лагранжа

Интуиция: от касательной прямой к касательной параболе

Вспомни: теорема Лагранжа утверждает, что $f(x) = f(a) + f'(c)(x-a)$ для некоторой точки $c$ между $a$ и $x$. Если переписать это чуть иначе, заменив неизвестную $c$ на известную $a$ с добавлением ошибки, получится приближённое равенство $f(x) \approx f(a) + f'(a)(x-a)$ — уравнение касательной прямой к графику функции в точке $a$. Это линейное приближение, и оно тем точнее, чем ближе $x$ к $a$, но у него есть очевидный недостаток: касательная прямая не «чувствует» кривизну графика, а значит, ошибка растёт довольно быстро при удалении от $a$.

Естественная идея — улучшить приближение, добавив квадратичный член, который отвечает за кривизну (вторую производную), затем кубический, который отвечает за то, как меняется сама кривизна, и так далее. Каждый следующий член учитывает всё более тонкие детали поведения функции, и многочлен всё плотнее «облегает» график в окрестности точки $a$. Формула Тейлора — это точная формализация этой идеи вместе с точной формулой для того, что осталось «неучтённым» — остаточного члена.

Теорема

Теорема (формула Тейлора с остаточным членом в форме Лагранжа). Пусть функция $f$ имеет непрерывные производные до порядка $n+1$ включительно на отрезке между точками $a$ и $x$. Тогда

$$f(x) = f(a) + f'(a)(x-a) + \frac{f''(a)}{2!}(x-a)^2 + \ldots + \frac{f^{(n)}(a)}{n!}(x-a)^n + R_n(x)$$

где остаточный член $R_n(x)$ можно записать в форме Лагранжа:

$$R_n(x) = \frac{f^{(n+1)}(c)}{(n+1)!}(x-a)^{n+1}$$

для некоторой точки $c$, лежащей строго между $a$ и $x$.

Сумму без остатка обычно называют многочленом Тейлора степени $n$ и обозначают

$$P_n(x) = \sum_{k=0}^{n} \frac{f^{(k)}(a)}{k!}(x-a)^k$$

так что формула Тейлора коротко записывается как $f(x) = P_n(x) + R_n(x)$.

Докажем формулу остатка, опираясь ровно на ту же логику, что и вывод правила Лопиталя из теоремы Коши в прошлом уроке. Зафиксируем точку $x$ и введём вспомогательную функцию переменной $t$ (лежащей между $a$ и $x$):

$$\varphi(t) = f(x) - \sum_{k=0}^{n} \frac{f^{(k)}(t)}{k!}(x-t)^k$$

Заметь: при $t=x$ вся сумма превращается в $f(x)$ (все слагаемые с $(x-t)^k$ при $k\ge1$ обнуляются, а слагаемое с $k=0$ равно $f(x)$), поэтому $\varphi(x)=0$. При $t=a$ сумма — это ровно многочлен Тейлора $P_n(x)$, поэтому $\varphi(a) = f(x) - P_n(x) = R_n(x)$ — то есть значение вспомогательной функции в точке $a$ и есть искомый остаток.

Продифференцируем $\varphi(t)$ по $t$. Каждое слагаемое суммы дифференцируется по правилу производной произведения, и все промежуточные члены при аккуратном подсчёте взаимно уничтожаются телескопически (производная $k$-го слагаемого частично сокращается с частью производной $(k+1)$-го слагаемого), оставляя только один член:

$$\varphi'(t) = -\frac{f^{(n+1)}(t)}{n!}(x-t)^n$$

Введём вторую вспомогательную функцию $\psi(t) = (x-t)^{n+1}$, для которой $\psi'(t) = -(n+1)(x-t)^n$, и заметим, что $\psi(x)=0$ тоже. Обе функции, $\varphi$ и $\psi$, непрерывны и дифференцируемы на отрезке между $a$ и $x$, а $\psi'(t)\ne0$ при $t\ne x$ — значит, к ним применима теорема Коши о среднем значении (урок 191):

$$\frac{\varphi(a)-\varphi(x)}{\psi(a)-\psi(x)} = \frac{\varphi'(c)}{\psi'(c)}, \qquad c \text{ между } a \text{ и } x$$

Подставляя $\varphi(x)=\psi(x)=0$ и найденные производные:

$$\frac{R_n(x)}{(x-a)^{n+1}} = \frac{-\dfrac{f^{(n+1)}(c)}{n!}(x-c)^n}{-(n+1)(x-c)^n} = \frac{f^{(n+1)}(c)}{(n+1)!}$$

откуда $R_n(x) = \dfrac{f^{(n+1)}(c)}{(n+1)!}(x-a)^{n+1}$, что и требовалось доказать.

Обрати внимание, насколько буквально это обобщение теоремы Лагранжа: если взять $n=0$, то $P_0(x)=f(a)$, а остаток $R_0(x) = f'(c)(x-a)$ — и вся формула Тейлора превращается ровно в $f(x)=f(a)+f'(c)(x-a)$, то есть в формулировку теоремы Лагранжа один в один. Формула Тейлора — это не отдельная, независимо придуманная теорема, а естественное продолжение той же самой линии рассуждений, которую ты уже прошёл в уроках про теоремы Ролля, Лагранжа, Коши и правило Лопиталя.

Разбор примеров

Пример 1 (лёгкий). Разложить $f(x)=x^3-2x+1$ по формуле Тейлора в окрестности точки $a=1$ до второй степени и найти точный остаточный член.

Находим значения функции и производных в точке $a=1$: $f(1)=1-2+1=0$; $f'(x)=3x^2-2$, $f'(1)=1$; $f''(x)=6x$, $f''(1)=6$; $f'''(x)=6$ (константа, значит третья производная в любой точке равна $6$).

$$P_2(x) = f(1)+f'(1)(x-1)+\frac{f''(1)}{2!}(x-1)^2 = 0+1\cdot(x-1)+\frac{6}{2}(x-1)^2 = (x-1)+3(x-1)^2$$

Остаточный член в форме Лагранжа: $R_2(x)=\dfrac{f'''(c)}{3!}(x-1)^3 = \dfrac{6}{6}(x-1)^3 = (x-1)^3$ (третья производная постоянна, поэтому $c$ вообще не влияет на значение остатка).

Ответ: $f(x) = (x-1)+3(x-1)^2+(x-1)^3$ — и это точное, а не приближённое равенство: если раскрыть скобки, получится в точности исходный многочлен $x^3-2x+1$. Это не случайность: для многочлена степени $n$ формула Тейлора степени $n$ и выше всегда даёт точное равенство без остатка, потому что все производные порядка выше $n$ равны нулю.

Пример 2 (средний). Показать явно, что формула Тейлора при $n=0$ совпадает с теоремой Лагранжа, на примере $f(x)=\sin x$ на отрезке от $a=0$ до $x=\frac{\pi}{2}$.

По формуле Тейлора при $n=0$: $P_0(x)=f(0)=\sin0=0$, остаток $R_0(x)=f'(c)\cdot x = \cos(c)\cdot\frac{\pi}{2}$ для некоторого $c\in\left(0,\frac{\pi}{2}\right)$. Значит формула утверждает:

$$\sin\frac{\pi}{2} = 0 + \cos(c)\cdot\frac{\pi}{2}$$

Подставим известное значение $\sin\frac{\pi}{2}=1$: получаем $1=\frac{\pi}{2}\cos c$, откуда $\cos c = \frac{2}{\pi}\approx0{,}6366$, то есть $c\approx0{,}881$ радиан — и действительно, эта точка лежит строго между $0$ и $\frac{\pi}{2}\approx1{,}571$.

Ответ: формула Тейлора нулевого порядка для $\sin x$ на $[0,\pi/2]$ в точности воспроизводит теорему Лагранжа: $\sin x - \sin 0 = \cos(c)\cdot x$ для некоторого $c$ между $0$ и $x$ — ровно то же самое утверждение, что и $f(x)-f(a)=f'(c)(x-a)$ из урока 191.

Пример 3 (сложный, ML). Вывести формулу шага метода Ньютона для минимизации функции потерь $L(\theta)$, используя квадратичную аппроксимацию по формуле Тейлора второго порядка вокруг текущей точки $\theta_k$.

Разложим $L(\theta)$ по формуле Тейлора до второго члена в окрестности $\theta_k$ (для функции нескольких переменных роль $f'(a)$ и $f''(a)$ играют градиент $\nabla L(\theta_k)$ и гессиан $H(\theta_k)$ — матрица вторых частных производных):

$$L(\theta) \approx L(\theta_k) + \nabla L(\theta_k)^\top(\theta-\theta_k) + \frac12(\theta-\theta_k)^\top H(\theta_k)(\theta-\theta_k)$$

Это квадратичная функция от $\theta$, и у неё есть явный минимум. Чтобы его найти, продифференцируем правую часть по $\theta$ и приравняем к нулю:

$$\nabla L(\theta_k) + H(\theta_k)(\theta-\theta_k) = 0$$

Отсюда, если гессиан обратим:

$$\theta = \theta_k - H(\theta_k)^{-1}\nabla L(\theta_k)$$

Ответ: это в точности формула шага метода Ньютона, $\theta_{k+1} = \theta_k - H(\theta_k)^{-1}\nabla L(\theta_k)$. Содержательно она означает: вместо того чтобы, как в обычном градиентном спуске, просто идти против градиента с произвольно выбранным шагом (learning rate), метод Ньютона строит локальную квадратичную «модель» функции потерь через формулу Тейлора и сразу прыгает в минимум этой модели — а поскольку квадратичная функция полностью определяется своим градиентом и гессианом, этот прыжок вычисляется за одну формулу, без подбора шага.

Почему это важно

Вывод остаточного члена в форме Лагранжа через теорему Коши — не абстрактное упражнение, а прямая демонстрация того, что весь аппарат матанализа, который ты изучал последние несколько уроков (теоремы Ролля, Лагранжа, Коши, правило Лопиталя), — это единая, последовательно выстроенная конструкция, где каждый следующий результат опирается на предыдущий. Формула Тейлора — не новая изолированная тема, а естественное продолжение и обобщение теоремы Лагранжа на случай, когда линейного приближения недостаточно и нужна более высокая точность — что в прикладных задачах, включая методы оптимизации второго порядка, встречается постоянно.

Формула Маклорена и остаточный член в форме Пеано

Интуиция: частный случай и «облегчённая» версия остатка

Когда точка разложения $a=0$, формула Тейлора называется формулой Маклорена — это просто удобный частный случай, а не отдельная теорема: всюду, где раньше стояло $(x-a)$, теперь стоит просто $x$. На практике формула Маклорена встречается чаще всего, потому что производные большинства элементарных функций (экспоненты, синуса, косинуса, логарифма) вычисляются в нуле особенно просто и дают узнаваемые закономерности.

Остаточный член в форме Лагранжа — мощный инструмент, потому что даёт точную формулу с конкретной (пусть и неизвестной) точкой $c$, которую можно оценить и получить явную числовую границу погрешности. Но иногда такая точность избыточна: если тебе нужно всего лишь показать, что остаток стремится к нулю быстрее, чем последний учтённый член разложения (а не выяснить точное числовое значение погрешности) — например, чтобы вычислить предел, — удобнее более простая, «облегчённая» форма остатка, которая ничего не говорит о точке $c$, зато сразу сообщает главное: порядок малости.

Теорема

Теорема (формула Маклорена; остаточный член в форме Пеано). Пусть функция $f$ имеет непрерывные производные до порядка $n$ в окрестности точки $0$. Тогда при $x\to0$

$$f(x) = f(0)+f'(0)x+\frac{f''(0)}{2!}x^2+\ldots+\frac{f^{(n)}(0)}{n!}x^n + o(x^n)$$

где $o(x^n)$ — остаток, который при $x\to0$ стремится к нулю быстрее, чем $x^n$, то есть $\dfrac{o(x^n)}{x^n}\to0$ при $x\to0$.

Разница между формой Лагранжа и формой Пеано принципиальна: форма Лагранжа — это точное равенство с конкретной (хоть и неизвестной) промежуточной точкой $c$, справедливое для любого фиксированного $x$ из области определения. Форма Пеано — это утверждение о поведении остатка вблизи точки разложения при $x\to0$: она ничего не говорит о том, чему равен остаток при конкретном, «не бесконечно малом» $x$, зато исключительно удобна там, где нужно только сравнить скорость убывания слагаемых — например, при вычислении пределов, как в примерах ниже.

Разбор примеров

Пример 1 (лёгкий). Разложить $f(x)=\cos x$ по формуле Маклорена до $x^2$ с остатком в форме Пеано и с помощью этого разложения приближённо вычислить $\cos(0{,}1)$.

Вычисляем: $f(0)=\cos0=1$; $f'(x)=-\sin x$, $f'(0)=0$; $f''(x)=-\cos x$, $f''(0)=-1$.

$$\cos x = 1 - \frac{x^2}{2} + o(x^2)$$

При $x=0{,}1$: $\cos(0{,}1)\approx1-\dfrac{0{,}01}{2}=1-0{,}005=0{,}995$.

Ответ: $\cos(0{,}1)\approx0{,}995$ — истинное значение $\cos(0{,}1)\approx0{,}99500$, то есть приближение верно уже до пятого знака после запятой при использовании всего одного нетривиального члена разложения.

Пример 2 (средний). Вычислить $\lim\limits_{x\to0}\dfrac{e^x-1-x}{x^2}$, используя разложение Маклорена (сравни с тем, как этот же предел вычислялся правилом Лопиталя в уроке 192).

Разложим $e^x$ по формуле Маклорена до второго порядка: $e^x = 1+x+\dfrac{x^2}{2}+o(x^2)$. Тогда числитель:

$$e^x-1-x = \frac{x^2}{2}+o(x^2)$$

Делим на $x^2$ и переходим к пределу:

$$\lim_{x\to0}\frac{e^x-1-x}{x^2} = \lim_{x\to0}\left(\frac12+\frac{o(x^2)}{x^2}\right) = \frac12+0 = \frac12$$

Ответ: $\dfrac12$ — тот же результат, что двукратное применение правила Лопиталя (см. задание 18 урока 192), но здесь он получен без единого дифференцирования «на лету»: всё, что нужно, — это заранее известное разложение экспоненты. Для пределов, где Лопиталя пришлось бы применять три-четыре раза подряд, разложение Маклорена часто оказывается быстрее.

Пример 3 (сложный, ML). Функция активации GELU определяется как $\text{GELU}(x) = x\Phi(x)$, где $\Phi(x)$ — функция распределения стандартного нормального закона. Найти разложение $\text{GELU}(x)$ по формуле Маклорена до второго порядка.

Функция $\Phi(x)$ имеет производную $\Phi'(x)=\varphi(x)=\dfrac{1}{\sqrt{2\pi}}e^{-x^2/2}$ — плотность стандартного нормального распределения. В нуле: $\Phi(0)=\dfrac12$ (по симметрии нормального распределения), $\Phi'(0)=\varphi(0)=\dfrac{1}{\sqrt{2\pi}}$.

$$\Phi(x) = \frac12+\frac{x}{\sqrt{2\pi}}+o(x)$$

Подставляем в определение GELU:

$$\text{GELU}(x) = x\Phi(x) = x\left(\frac12+\frac{x}{\sqrt{2\pi}}+o(x)\right) = \frac{x}{2}+\frac{x^2}{\sqrt{2\pi}}+o(x^2)$$

Ответ: $\text{GELU}(x) \approx \dfrac{x}{2}+\dfrac{x^2}{\sqrt{2\pi}}$ вблизи нуля. Это не абстрактная выкладка: именно из-за того, что $\Phi(x)$ (а значит, и вся GELU) не выражается через элементарные функции в замкнутом виде, на практике её приближают полиномиальными и гиперболическими разложениями — самая известная практическая аппроксимация, $\text{GELU}(x)\approx0{,}5x\left(1+\tanh\left[\sqrt{2/\pi}\left(x+0{,}044715x^3\right)\right]\right)$, устроена именно как разложение функции ошибок $\text{erf}$ по степеням $x$ с удержанным кубическим членом — прямое инженерное применение идеи формулы Тейлора: там, где точная функция «дорога» в вычислении, её заменяют многочленом с контролируемой погрешностью.

Почему это важно

Форма Пеано — это не более слабая версия формулы Тейлора, а инструмент, заточенный под другую задачу: не под численную оценку погрешности при конкретном $x$, а под сравнение скоростей убывания величин вблизи точки. Именно поэтому она особенно удобна для вычисления пределов вида $\frac00$ — там, где правило Лопиталя из прошлого урока требует многократного дифференцирования, разложение Маклорена часто сразу показывает главный член асимптотики и позволяет вычислить предел за один шаг, если разложения нужных функций уже известны наизусть.

Формула Маклорена для основных элементарных функций

Интуиция: набор строительных блоков

Производные экспоненты, синуса, косинуса, логарифма и степенной функции в нуле подчиняются простым закономерностям, из-за которых их разложения Маклорена превращаются в узнаваемые, легко запоминаемые ряды. Если держать эти пять разложений «в кармане», можно быстро получать разложения куда более сложных составных функций — подстановкой аргумента, перемножением, делением рядов — вместо того чтобы каждый раз заново дифференцировать с нуля. Это ровно та же логика, что таблица производных: не выводить каждый раз производную синуса из определения, а помнить готовый результат и пользоваться им.

Теорема (сводная таблица стандартных разложений)

Разложения Маклорена основных элементарных функций (остаток в форме Пеано, порядок указан для каждой функции отдельно):

$$e^x = 1+x+\frac{x^2}{2!}+\frac{x^3}{3!}+\ldots+\frac{x^n}{n!}+o(x^n)$$$$\sin x = x-\frac{x^3}{3!}+\frac{x^5}{5!}-\ldots+(-1)^n\frac{x^{2n+1}}{(2n+1)!}+o\left(x^{2n+2}\right)$$$$\cos x = 1-\frac{x^2}{2!}+\frac{x^4}{4!}-\ldots+(-1)^n\frac{x^{2n}}{(2n)!}+o\left(x^{2n+1}\right)$$$$\ln(1+x) = x-\frac{x^2}{2}+\frac{x^3}{3}-\ldots+(-1)^{n-1}\frac{x^n}{n}+o(x^n)$$$$(1+x)^\alpha = 1+\alpha x+\frac{\alpha(\alpha-1)}{2!}x^2+\ldots+\frac{\alpha(\alpha-1)\cdots(\alpha-n+1)}{n!}x^n+o(x^n)$$

Последнее разложение называют биномиальным рядом — оно обобщает бином Ньютона на любой (не обязательно целый) показатель степени $\alpha$: если $\alpha$ — натуральное число, ряд обрывается сам собой (все коэффициенты с номером больше $\alpha$ обращаются в ноль, потому что среди множителей $\alpha(\alpha-1)\cdots(\alpha-n+1)$ появляется множитель $0$), и получается обычная формула бинома Ньютона. При нецелом $\alpha$ (например, $\alpha=\frac12$ для корня) ряд не обрывается, и приходится держать остаток $o(x^n)$ или конечное число членов.

Все эти разложения получаются одинаково: последовательным дифференцированием и подстановкой $x=0$. Например, для $e^x$ все производные совпадают с самой функцией ($({e^x})^{(k)}=e^x$), а в нуле $e^0=1$ — отсюда коэффициент $\frac{1}{k!}$ перед каждой степенью. Для $\sin x$ производные циклически повторяются с периодом $4$ ($\sin\to\cos\to-\sin\to-\cos\to\sin\to\ldots$), и в точке $0$ они поочерёдно равны $0,1,0,-1,0,1,\ldots$ — отсюда исчезают все чётные степени, а нечётные чередуют знак.

Разбор примеров

Пример 1 (лёгкий). Разложить $f(x)=e^{2x}$ по формуле Маклорена до $x^3$, используя готовое разложение $e^u$.

Подставим $u=2x$ в стандартное разложение $e^u=1+u+\dfrac{u^2}{2}+\dfrac{u^3}{6}+o(u^3)$:

$$e^{2x} = 1+2x+\frac{(2x)^2}{2}+\frac{(2x)^3}{6}+o(x^3) = 1+2x+2x^2+\frac{4x^3}{3}+o(x^3)$$

Ответ: $e^{2x} = 1+2x+2x^2+\dfrac{4x^3}{3}+o(x^3)$.

Пример 2 (средний). Разложить $f(x)=\ln(1-x^2)$ по формуле Маклорена до $x^4$, используя разложение $\ln(1+u)$ с подстановкой $u=-x^2$.

Стандартное разложение: $\ln(1+u)=u-\dfrac{u^2}{2}+o(u^2)$. Подставим $u=-x^2$:

$$\ln(1-x^2) = (-x^2)-\frac{(-x^2)^2}{2}+o(x^4) = -x^2-\frac{x^4}{2}+o(x^4)$$

Ответ: $\ln(1-x^2)=-x^2-\dfrac{x^4}{2}+o(x^4)$. Обрати внимание на технику: подстановка $u=-x^2$ автоматически «прыгает» через два порядка малости за раз ($u^2=x^4$), поэтому разложения $\ln(1+u)$ до $u^2$ хватило, чтобы получить разложение по $x$ сразу до четвёртой степени.

Пример 3 (сложный, ML). Найти разложение Маклорена сигмоиды $\sigma(x)=\dfrac{1}{1+e^{-x}}$ до $x^3$, используя тождество $\sigma'(x)=\sigma(x)(1-\sigma(x))$.

$\sigma(0)=\dfrac12$. Первая производная: $\sigma'(0)=\sigma(0)(1-\sigma(0))=\dfrac12\cdot\dfrac12=\dfrac14$.

Продифференцируем тождество $\sigma'=\sigma(1-\sigma)=\sigma-\sigma^2$ ещё раз: $\sigma''=\sigma'-2\sigma\sigma'=\sigma'(1-2\sigma)$. При $x=0$: $\sigma''(0)=\dfrac14\cdot(1-1)=0$.

Дифференцируем $\sigma''=\sigma'(1-2\sigma)$ ещё раз по правилу производной произведения: $\sigma'''=\sigma''(1-2\sigma)-2(\sigma')^2$. При $x=0$: $\sigma'''(0)=0\cdot(1-1)-2\left(\dfrac14\right)^2=-\dfrac18$.

$$\sigma(x) = \frac12+\frac14x+\frac{0}{2!}x^2+\frac{-1/8}{3!}x^3+o(x^3) = \frac12+\frac{x}{4}-\frac{x^3}{48}+o(x^3)$$

Ответ: $\sigma(x)\approx\dfrac12+\dfrac{x}{4}-\dfrac{x^3}{48}$ вблизи нуля. Отсутствие квадратичного члена — не случайность, а следствие того, что $\sigma(x)-\frac12$ является нечётной функцией (сигмоида центрально-симметрична относительно точки $\left(0,\frac12\right)$): в разложении нечётной функции вокруг центра симметрии никогда не бывает членов с чётными степенями.

Почему это важно

Держать эти пять разложений под рукой — не упражнение на память ради памяти: почти любая функция, встречающаяся в анализе данных и машинном обучении (сигмоида, softplus, GELU, распределения вероятностей, функции потерь), либо сама является комбинацией $e^x$, $\ln(1+x)$ и степенных функций, либо приближается ими. Умение быстро подставить, перемножить или разделить готовые ряды экономит время там, где повторный вывод разложения с нуля через дифференцирование занял бы в разы больше шагов.

Применение формулы Тейлора для приближённых вычислений и оценки погрешности

Интуиция: гарантия, а не догадка

Главная практическая ценность формулы Тейлора — не в самом факте, что многочлен «примерно» похож на функцию, а в том, что остаточный член в форме Лагранжа даёт возможность заранее, до всяких вычислений, гарантировать точность приближения. Это принципиально отличает формулу Тейлора от простого «подставим несколько членов ряда и понадеемся, что этого хватит»: у тебя на руках оказывается строгая верхняя граница ошибки, которую можно проверить и, если нужно, уменьшить, взяв на один член больше.

Теорема (оценка остатка)

Оценка погрешности через форму Лагранжа. Если на отрезке между $a$ и $x$ выполняется неравенство $\left|f^{(n+1)}(t)\right|\le M_{n+1}$ для некоторой константы $M_{n+1}$, то

$$|R_n(x)| = \left|\frac{f^{(n+1)}(c)}{(n+1)!}(x-a)^{n+1}\right| \le \frac{M_{n+1}}{(n+1)!}|x-a|^{n+1}$$

Идея использования этой оценки на практике всегда одна и та же: сначала оценить (или явно вычислить) максимум модуля нужной производной на интересующем отрезке, затем подставить в формулу и получить явную числовую границу для ошибки — не дожидаясь, пока станет известно точное значение неизвестной точки $c$.

Разбор примеров

Пример 1 (лёгкий). Вычислить $e^{0{,}1}$ по формуле Маклорена, взяв три члена разложения ($1+x+\frac{x^2}{2}$), и оценить погрешность с помощью остатка в форме Лагранжа.

Приближение: $e^{0{,}1}\approx1+0{,}1+\dfrac{0{,}01}{2}=1+0{,}1+0{,}005=1{,}105$.

Оценка остатка: $R_2(0{,}1)=\dfrac{f'''(c)}{3!}(0{,}1)^3=\dfrac{e^c}{6}\cdot0{,}001$ для некоторого $c\in(0,0{,}1)$. Так как на этом отрезке $e^c $$|R_2(0{,}1)| < \frac{2}{6}\cdot0{,}001 \approx 0{,}00033$$

Ответ: $e^{0{,}1}\approx1{,}105$ с гарантированной погрешностью не более $0{,}00033$. Истинное значение $e^{0{,}1}\approx1{,}10517$, и фактическая ошибка приближения $\approx0{,}00017$ действительно укладывается в предсказанную границу.

Пример 2 (средний). Вычислить $\sin(0{,}2)$ по разложению $\sin x\approx x-\dfrac{x^3}{6}$ и оценить погрешность через остаток в форме Лагранжа для $n=3$ (остаток вида $R_3$, где используется четвёртая производная).

Приближение: $\sin(0{,}2)\approx0{,}2-\dfrac{0{,}008}{6}=0{,}2-0{,}001333=0{,}198667$.

Четвёртая производная синуса — это $\sin x$ с точностью до знака ($(\sin x)^{(4)}=\sin x$), и на любом отрезке $|\sin t|\le1$. Оценка остатка:

$$|R_3(0{,}2)| = \left|\frac{f^{(4)}(c)}{4!}(0{,}2)^4\right| \le \frac{1}{24}\cdot0{,}0016 \approx 0{,}0000667$$

Ответ: $\sin(0{,}2)\approx0{,}19867$ с погрешностью не более $0{,}0000667$. Истинное значение $\sin(0{,}2)\approx0{,}198669$ — приближение верно уже до пятого знака после запятой.

Пример 3 (сложный, ML). Объяснить, опираясь на порядок остатка в формуле Тейлора, почему метод Ньютона для минимизации гладкой строго выпуклой функции потерь $L(\theta)$ сходится к минимуму $\theta^*$ квадратично — то есть ошибка на следующем шаге пропорциональна квадрату текущей ошибки.

Пусть $e_k=\theta_k-\theta^*$ — ошибка на шаге $k$. В точке минимума градиент равен нулю: $\nabla L(\theta^*)=0$. Разложим $\nabla L(\theta_k)$ по формуле Тейлора вокруг $\theta^*$ до линейного члена с остатком:

$$\nabla L(\theta_k) = \nabla L(\theta^*) + H(\theta^*)\,e_k + O\!\left(e_k^2\right) = H(\theta^*)\,e_k + O\!\left(e_k^2\right)$$

(слагаемое $O(e_k^2)$ здесь возникает именно как остаточный член следующего порядка формулы Тейлора для градиента — третьего порядка для самой функции потерь).

Шаг метода Ньютона: $\theta_{k+1}=\theta_k-H(\theta_k)^{-1}\nabla L(\theta_k)$. Если гессиан достаточно гладкий, $H(\theta_k)\approx H(\theta^*)$ вблизи минимума, и тогда:

$$e_{k+1} = \theta_{k+1}-\theta^* = e_k - H(\theta_k)^{-1}\Bigl[H(\theta^*)e_k+O(e_k^2)\Bigr] \approx e_k - e_k - H(\theta^*)^{-1}O(e_k^2) = O\!\left(e_k^2\right)$$

Ответ: $|e_{k+1}| = O\!\left(|e_k|^2\right)$ — квадратичная сходимость метода Ньютона. Содержательно: линейная часть ошибки $e_k$ полностью «уничтожается» шагом Ньютона (потому что шаг явно строится так, чтобы обнулить линейное приближение градиента), и остаётся только член следующего порядка малости — прямое следствие того, что формула Тейлора даёт контролируемый остаток на каждом уровне точности. Именно поэтому вблизи минимума метод Ньютона сходится за считаные итерации, в отличие от линейной (не квадратичной) сходимости обычного градиентного спуска.

Почему это важно

Оценка погрешности через форму Лагранжа превращает формулу Тейлора из красивой теоретической конструкции в инженерный инструмент: она отвечает не только на вопрос «чем приближённо заменить функцию», но и на вопрос «насколько я имею право доверять этому приближению». Ровно эта же логика — контролируемая, оцениваемая сверху погрешность аппроксимации — лежит в основе анализа сходимости практически всех итерационных методов оптимизации в машинном обучении, от метода Ньютона до его приближённых версий (квазиньютоновские методы вроде BFGS), где точный гессиан заменяют его дешёвым приближением, жертвуя частью скорости сходимости ради вычислительной эффективности.

Практика: 30 заданий

Базовые задания (1–10)

Задание 1: Разложить $f(x)=e^x$ по формуле Маклорена до $x^2$ и записать остаточный член в форме Пеано.


Задание 2: Разложить $f(x)=\cos x$ по формуле Маклорена до $x^4$.


Задание 3: Разложить $f(x)=\sin x$ по формуле Маклорена до $x^3$.


Задание 4: Разложить $f(x)=\ln(1+x)$ по формуле Маклорена до $x^3$.


Задание 5: Найти многочлен Тейлора второй степени для $f(x)=\sqrt{x}$ в окрестности точки $a=4$.


Задание 6: Записать формулу Тейлора для $f(x)=\dfrac1x$ в окрестности $a=1$ до первой степени и явно выписать остаточный член в форме Лагранжа.


Задание 7: Используя теорему Лагранжа как частный случай формулы Тейлора при $n=0$, приближённо оценить $f(4{,}01)$ для $f(x)=\sqrt{x}$, зная $f(4)=2$, $f'(x)=\dfrac{1}{2\sqrt{x}}$.


Задание 8: Найти многочлен Маклорена третьей степени для $f(x)=e^{-x}$.


Задание 9: Используя разложение $e^x\approx1+x+\dfrac{x^2}{2}$, вычислить приближённо $e^{0{,}1}$ и сравнить с истинным значением $e^{0{,}1}\approx1{,}10517$.


Задание 10: Используя разложение $\sin x\approx x-\dfrac{x^3}{6}$, вычислить приближённо $\sin(0{,}3)$ и сравнить с истинным значением $\sin(0{,}3)\approx0{,}29552$.


Средние задания (11–20)

Задание 11: Разложить $f(x)=\sqrt{1+x}$ по формуле Маклорена до $x^2$, используя биномиальный ряд с $\alpha=\frac12$.


Задание 12: Разложить $f(x)=\dfrac{1}{1-x}$ по формуле Маклорена до $x^3$.


Задание 13: Используя разложения $e^x$ и $e^{-x}$, найти разложение Маклорена гиперболического синуса $\text{sh}\,x = \dfrac{e^x-e^{-x}}{2}$ до $x^3$.


Задание 14: Вычислить $\lim\limits_{x\to0}\dfrac{e^x-1-x}{x^2}$, используя разложение Маклорена.


Задание 15: Вычислить $\lim\limits_{x\to0}\dfrac{\cos x-1+\dfrac{x^2}{2}}{x^4}$, используя разложение $\cos x$.


Задание 16: Оценить погрешность приближения $\ln(1{,}1)\approx0{,}1-\dfrac{0{,}01}{2}$ (два члена разложения $\ln(1+x)$), используя остаточный член в форме Лагранжа.


Задание 17: Разложить $f(x)=e^{2x}$ по формуле Маклорена до $x^3$.


Задание 18: Разложить $f(x)=\ln(1-x^2)$ по формуле Маклорена до $x^4$.


Задание 19 (ML): Записать квадратичную аппроксимацию функции потерь $L(\theta)$ по формуле Тейлора в окрестности точки $\theta_0$ через градиент и гессиан и вывести формулу шага метода Ньютона.


Задание 20 (ML): Найти разложение Маклорена сигмоиды $\sigma(x)=\dfrac{1}{1+e^{-x}}$ до $x^3$, используя $\sigma'=\sigma(1-\sigma)$.


Продвинутые задания (21–30)

Задание 21: Показать, что формула Тейлора при $n=0$ совпадает с теоремой Лагранжа о конечных приращениях.


Задание 22: Разложить $f(x)=(1+x)^{-2}$ по формуле Маклорена до $x^3$, используя биномиальный ряд с $\alpha=-2$.


Задание 23: Вычислить $\lim\limits_{x\to0}\dfrac{\ln(1+x)-x+\dfrac{x^2}{2}}{x^3}$, используя разложение Маклорена.


Задание 24 (ML): Используя разложение GELU$(x)=x\Phi(x)\approx\dfrac{x}{2}+\dfrac{x^2}{\sqrt{2\pi}}$ (полученное в теоретической части урока), оценить приближённое значение $\text{GELU}(0{,}05)$.


Задание 25: Найти многочлен Тейлора третьей степени для $f(x)=\text{tg}\,x$ в окрестности $a=0$.


Задание 26: Используя остаточный член в форме Лагранжа, доказать, что при вычислении $e\approx1+1+\dfrac{1}{2!}+\dfrac{1}{3!}+\ldots+\dfrac{1}{n!}$ погрешность не превышает $\dfrac{3}{(n+1)!}$.


Задание 27 (ML): Опираясь на формулу Тейлора второго порядка, объяснить, почему метод Ньютона для строго выпуклой функции потерь сходится к минимуму квадратично.


Задание 28: Разложить $f(x)=\text{arctg}\,x$ по формуле Маклорена до $x^5$, используя разложение $\dfrac{1}{1+x^2}$ и почленное интегрирование.


Задание 29: Найти многочлен Тейлора второй степени для функции двух переменных $f(x,y)=x^2y+e^{x+y}$ в окрестности точки $(0,0)$.


Задание 30 (ML): Функция потерь двух параметров $L(\theta_1,\theta_2)$ в точке минимума $\theta^*=(0,0)$ имеет нулевой градиент, гессиан $H=\begin{pmatrix}4&1\\1&2\end{pmatrix}$ и $L(0,0)=5$. Оценить $L(0{,}1;\,-0{,}1)$, используя квадратичную аппроксимацию по формуле Тейлора.


Частые ошибки

Ошибка 1. Путают форму Лагранжа и форму Пеано, пытаясь получить из формы Пеано точную числовую оценку погрешности.

Как выглядит: записывают $f(x)=P_n(x)+o\bigl((x-a)^n\bigr)$ и после этого пытаются подставить конкретное числовое значение $x$, чтобы «вычислить» остаток.

Почему возникает: обе формы выглядят похоже и решают на первый взгляд одну и ту же задачу — оценить остаток, — но форма Пеано в принципе не содержит информации о величине остатка при фиксированном $x$, только о его поведении в пределе при $x\to a$.

Как правильно: для численной оценки погрешности при конкретном $x$ всегда использовать форму Лагранжа с оценкой $M_{n+1}$ для $\left|f^{(n+1)}\right|$; форму Пеано применять только там, где задача — сравнение порядков малости (пределы, качественный анализ поведения вблизи точки), как в заданиях 14–15, 23.

Ошибка 2. Забывают, что точка $c$ в остатке Лагранжа неизвестна, и подставляют вместо неё саму точку $a$ или $x$.

Как выглядит: при вычислении $R_n(x)=\dfrac{f^{(n+1)}(c)}{(n+1)!}(x-a)^{n+1}$ вместо $c$ подставляют $a$ (или $x$), получая конкретное число вместо оценки.

Почему возникает: хочется получить точный ответ, а не диапазон, и кажется естественным взять «граничное» значение вместо неизвестного $c$.

Как правильно: $c$ — это некоторая точка между $a$ и $x$, конкретное значение которой в общем случае неизвестно. Правильный путь — оценить $\left|f^{(n+1)}(t)\right|$ сверху константой $M_{n+1}$ для всех $t$ на этом отрезке и получить гарантированную границу погрешности (как в заданиях 16, 26), а не точное значение остатка.

Ошибка 3. Путают порядок разложения с числом удержанных членов, из-за чего теряют или, наоборот, лишний раз добавляют слагаемые.

Как выглядит: просят «разложение до $x^3$», а фактически выписывают члены только до $x^2$ или ошибочно добавляют член с $x^4$.

Почему возникает: при разложении функций вроде $\cos x$ или $\sin x$ часть степеней отсутствует (только чётные или только нечётные), и легко сбиться со счёта, какая степень действительно является «последней учтённой».

Как правильно: явно выписывать все производные по порядку от нулевого до нужного и проверять степень последнего слагаемого перед остатком — сверяясь с заданным порядком (см. задания 2–3, где чётные и нечётные степени последовательно чередуются с нулевыми коэффициентами).

Ошибка 4. При разложении сложной функции через подстановку в стандартный ряд забывают, что порядок остатка меняется вместе с заменой переменной.

Как выглядит: подставляют $u=x^2$ в разложение $\ln(1+u)=u-\frac{u^2}{2}+o(u^2)$ и по инерции пишут итоговый остаток как $o(x^2)$, хотя на самом деле после подстановки $u=x^2$ остаток становится $o(x^4)$.

Почему возникает: легко забыть пересчитать порядок малости остатка при переходе от переменной $u$ к переменной $x$, особенно если подстановка нелинейная.

Как правильно: всегда явно отслеживать, во что превращается $o(u^k)$ после подстановки конкретного выражения вместо $u$ — если $u=x^2$, то $o(u^k)=o(x^{2k})$ (см. задания 18 и разбор в теоретической части про $\ln(1-x^2)$).

Ошибка 5. Применяют разложение Маклорена (при $a=0$) там, где точка разложения задана другой — например, $a=4$ или $a=1$ — не пересчитывая производные в правильной точке.

Как выглядит: для задачи с $a=4$ по ошибке используют производные, вычисленные в нуле, вместо производных, вычисленных в $4$.

Почему возникает: стандартные разложения элементарных функций (таблица из этого урока) все даны именно для $a=0$, и привычка автоматически применять их иногда переносится на задачи с произвольной точкой разложения.

Как правильно: формула Маклорена — лишь частный случай формулы Тейлора при $a=0$; если задача явно требует разложения в окрестности другой точки (как в заданиях 5–7), все производные нужно вычислять именно в этой точке, а не в нуле.

Ошибка 6. Забывают проверить условие достаточной гладкости функции (наличие производной нужного порядка) перед применением формулы.

Как выглядит: пытаются разложить функцию с изломом или разрывом производной высокого порядка, не обратив внимание, что нужная производная в точке разложения попросту не существует.

Почему возникает: формула Тейлора кажется применимой к любой «достаточно хорошей» функции, а вопрос о существовании конкретной производной высокого порядка легко упустить, особенно для составных функций.

Как правильно: прежде чем выписывать разложение до порядка $n$, убедиться, что функция имеет непрерывные производные вплоть до порядка $n+1$ в нужной окрестности — для всех элементарных функций из таблицы этого урока (кроме степенной с $\alpha<0$ вблизи нуля) это условие выполняется автоматически, но для составных или кусочно заданных функций его стоит проверять явно.

Главное запомнить

  • Формула Тейлора: $f(x) = f(a)+f'(a)(x-a)+\dfrac{f''(a)}{2!}(x-a)^2+\ldots+\dfrac{f^{(n)}(a)}{n!}(x-a)^n+R_n(x)$ — точное представление функции как суммы многочлена и остатка.

  • Остаток в форме Лагранжа: $R_n(x)=\dfrac{f^{(n+1)}(c)}{(n+1)!}(x-a)^{n+1}$ для некоторой точки $c$ между $a$ и $x$ — это прямое обобщение теоремы Лагранжа, которая получается ровно при $n=0$.

  • Доказательство остатка в форме Лагранжа опирается на теорему Коши, применённую к специально построенным вспомогательным функциям — та же логика, что использовалась при выводе правила Лопиталя в предыдущем уроке.

  • Формула Маклорена — частный случай формулы Тейлора при $a=0$, с ней связаны самые узнаваемые и часто используемые разложения элементарных функций.

  • Остаток в форме Пеано, $o\bigl((x-a)^n\bigr)$, говорит только о том, что остаток убывает быстрее последнего учтённого члена при $x\to a$ — он не даёт числовой оценки погрешности при конкретном $x$, зато удобен для вычисления пределов.

  • Пять базовых разложений стоит держать наизусть: $e^x$, $\sin x$, $\cos x$, $\ln(1+x)$, $(1+x)^\alpha$ — почти любое более сложное разложение получается из них подстановкой аргумента или комбинированием.

  • Оценка погрешности приближённых вычислений строится через форму Лагранжа: $|R_n(x)|\le\dfrac{M_{n+1}}{(n+1)!}|x-a|^{n+1}$, где $M_{n+1}$ — оценка максимума модуля $(n+1)$-й производной на нужном отрезке.

  • В ML квадратичная часть формулы Тейлора (градиент и гессиан) — это математическая основа метода Ньютона второго порядка: шаг $\theta_{k+1}=\theta_k-H(\theta_k)^{-1}\nabla L(\theta_k)$ получается как минимум квадратичной модели функции потерь.

  • Квадратичная сходимость метода Ньютона вблизи минимума — прямое следствие того, что остаток формулы Тейлора для градиента имеет второй порядок малости: линейная часть ошибки обнуляется шагом Ньютона по построению.

  • Для многочлена степени $n$ формула Тейлора того же (или более высокого) порядка не приближает, а точно воспроизводит исходную функцию без остатка — все производные выше степени многочлена равны нулю.

Связь с другими темами курса

Что нужно было знать до этого урока

Формула Тейлора целиком опирается на теорему Коши о среднем значении (урок 191) и её частный случай — теорему Лагранжа (урок 190): доказательство остаточного члена в форме Лагранжа строится через те же вспомогательные функции и ту же логику предельного перехода точки $c$, что использовались при выводе правила Лопиталя (урок 192). Также нужны свободное владение таблицей производных элементарных функций и понятие производных высших порядков (правило нахождения $f''$, $f'''$ и далее) из уроков про непрерывность, разрывы, производную и дифференциал.

Что изучить дальше

В следующем уроке, 194 «Ряд Тейлора», конечная сумма $n$ слагаемых превращается в бесконечный ряд — ты увидишь, при каких условиях остаток $R_n(x)$ действительно стремится к нулю при $n\to\infty$ (а не просто становится сколь угодно малым для фиксированного $n$ при $x\to a$, как в этом уроке), и когда функцию можно представить не приближённо, а точно как сумму бесконечного числа степенных слагаемых. Формула Тейлора этого урока — фундамент, на котором строится вся теория степенных рядов, включая радиус сходимости и область, где разложение действительно совпадает с исходной функцией.

Где это нужно в жизни

🤖 ML/AI. Метод Ньютона и квазиньютоновские методы оптимизации второго порядка (BFGS, L-BFGS) строятся на квадратичной аппроксимации функции потерь через формулу Тейлора (задания 19, 27, 30); полиномиальные и рациональные приближения «дорогих» гладких функций активации вроде GELU и приближений функции ошибок $\text{erf}$ (задание 24); анализ скорости сходимости оптимизаторов через порядок остаточного члена.

📊 Численные методы. Вся числовая математика — вычисление функций компьютером с гарантированной точностью, методы интегрирования и решения дифференциальных уравнений (метод Рунге — Кутты) — опирается на разложения Тейлора и контролируемую оценку погрешности через остаточный член (задания 9, 10, 16, 26).

🔬 Физика и инженерия. Линеаризация нелинейных дифференциальных уравнений вблизи положения равновесия (например, приближение $\sin\theta\approx\theta$ для малых колебаний маятника — это ровно первый член разложения Маклорена синуса) — стандартный инструмент теоретической механики и теории управления.

💰 Финансы и эконометрика. Аппроксимация цены финансовых деривативов через греки (дельту, гамму) — это в точности формула Тейлора второго порядка для функции цены опциона по цене базового актива, где дельта играет роль первой производной, а гамма — роль второй.

Интересные факты

  • Сам Брук Тейлор не давал своему ряду никакого специального названия и не рассматривал вопрос о том, где ряд вообще сходится к исходной функции, — это стало серьёзной математической проблемой лишь столетие спустя, когда выяснилось, что существуют бесконечно гладкие функции (например, знаменитая $e^{-1/x^2}$ с доопределением в нуле), ряд Тейлора которых сходится, но сходится не к самой функции.

  • Формула Маклорена названа в честь человека, который сам писал в своей книге, что не претендует на приоритет этого разложения, — редкий в истории математики случай подчёркнуто честного указания на чужой более ранний результат, в отличие от истории с правилом Лопиталя из предыдущего урока.

  • Остаточный член в форме Пеано назван в честь итальянского математика Джузеппе Пеано (1858–1932) — того самого, кто известен аксиомами Пеано для натуральных чисел; идею записи остатка через символ $o(\cdot)$ («о малое») он предложил значительно позже самой формулы Тейлора, в конце XIX века, когда математики начали систематически формализовывать язык асимптотических сравнений.

  • В инженерной практике многочлены Тейлора невысокой степени (обычно второй-третьей) настолько прочно вошли в обиход, что получили собственные названия для конкретных приложений — например, «параболическая аппроксимация» в численных методах или «квадратичная модель доверительной области» (trust region) в оптимизации — по сути это всё та же формула Тейлора, только под другим именем в другой предметной области.

Лайфхаки и полезные трюки

  1. Выучи пять базовых разложений Маклорена наизусть ($e^x$, $\sin x$, $\cos x$, $\ln(1+x)$, $(1+x)^\alpha$) — почти любая практическая задача сводится к подстановке аргумента или комбинированию этих пяти рядов, а не к дифференцированию с нуля (см. примеры в разделе про элементарные функции).

  2. При подстановке $u=g(x)$ в стандартный ряд всегда пересчитывай порядок остатка — если $u=x^2$, то $o(u^k)$ автоматически превращается в $o(x^{2k})$, а не в $o(x^k)$ (см. Ошибку 4 и задание 18).

  3. Для вычисления пределов вида $\frac00$ сначала попробуй разложение Маклорена, а не правило Лопиталя — если нужные разложения уже известны наизусть, результат часто получается за один шаг вместо нескольких последовательных дифференцирований (сравни задание 14 этого урока с заданием 18 урока 192).

  4. Перед оценкой остатка в форме Лагранжа сначала найди, на каком отрезке и какой производной нужна оценка сверху — а не пытайся вычислить точное значение неизвестной точки $c$: задача всегда сводится к поиску константы $M_{n+1}$, ограничивающей модуль нужной производной (задания 16, 26).

  5. Для функций с явной симметрией (чётной или нечётной) заранее знай, какие степени в разложении обнулятся — у чётной функции ($\cos x$) остаются только чётные степени, у нечётной ($\sin x$, $\text{sh}\,x$, $\text{arctg}\,x$, а также $\sigma(x)-\frac12$ для сигмоиды) — только нечётные, и половину коэффициентов можно даже не вычислять.

  6. В задачах машинного обучения ищи в формуле Тейлора градиент и гессиан — как только видишь фразу «квадратичная аппроксимация функции потерь», это прямая отсылка к формуле Тейлора второго порядка, и вся дальнейшая алгебра (метод Ньютона, доверительные области, анализ сходимости) строится именно на ней (задания 19, 27, 30).

  7. Проверяй разложение на частном случае, где ответ известен заранее — например, подставь $\alpha=$ натуральное число в биномиальный ряд и убедись, что получается обычный бином Ньютона с конечным числом слагаемых (см. связь заданий 11, 12, 22 с классическим биномом).

Формула Тейлора — это, пожалуй, самый практичный результат всего курса математического анализа: она не просто доказывает абстрактный факт о существовании хорошего приближения, а даёт готовый рецепт — как именно строить это приближение и насколько ему можно доверять. Дальше, встречая ли задачу приближённого вычисления, метод оптимизации второго порядка в машинном обучении или гладкую аппроксимацию неудобной функции активации, ты будешь узнавать в ней всё ту же конструкцию: многочлен, который «облегает» функцию вблизи точки, и остаток, чью величину теперь умеешь честно оценить, а не просто на неё надеяться.

Понял тему? Закрепи в боте! 🚀

Попрактикуйся на задачах и получи персональные рекомендации от AI

💪 Начать тренировку
💬 Есть вопрос? Спроси бота!