Квадратичные формы 🥣
Возьми функцию $f(x, y) = x^2 + y^2$. Её график — идеальная чаша, дно ровно в начале координат, и куда ни сдвинься, значение только растёт. А теперь возьми $f(x,y) = x^2 - y^2$ — график превращается в седло: вдоль одной оси функция растёт, вдоль другой падает, а в начале координат нет ни минимума, ни максимума. Обе функции — квадратичные формы от двух переменных, и разница между чашей и седлом — это ровно то, чему посвящён этот урок.
Квадратичная форма — это однородный многочлен второй степени: сумма слагаемых вида $a_{ij}x_ix_j$, без линейных членов и без свободного члена. Записывать её через отдельные коэффициенты неудобно уже при трёх переменных и невозможно при обозримом усилии при ста. Но её можно свернуть в одну компактную запись $Q(x) = x^TAx$ с симметричной матрицей $A$ — и тогда вся техника предыдущих уроков, от определителей до собственных значений, начинает работать на классификацию поведения формы: где у неё чаша, где седло, а где что-то ещё.
Именно эта классификация — знакоопределённость — оказывается центральным объектом в оптимизации, а значит и в машинном обучении. Функция потерь нейросети — не квадратичная форма в чистом виде, но её поведение вблизи любой точки с точностью до малых поправок описывается именно квадратичной формой — гессианом. Если гессиан в точке положительно определён, эта точка — локальный минимум, дно чаши. Если он знакопеременный — седло, а не минимум, и градиентный спуск может застрять рядом с ним надолго. Ковариационная матрица — это тоже симметричная матрица, и оказывается, что она всегда задаёт квадратичную форму одного конкретного типа, что бы за данные в неё ни подставили. Это не совпадение, а прямое следствие того, как она построена, и мы это докажем на одной строчке.
Инструмент для всей этой классификации у тебя уже есть — собственные значения и определители из предыдущих уроков. Урок 172 научил находить $\lambda$, урок 173 — собирать из них диагональную форму матрицы. Здесь эта техника применяется к симметричным матрицам и даёт готовый, проверяемый руками критерий: критерий Сильвестра. А связующим звеном между алгеброй и геометрией послужит приведение формы к каноническому виду — тому самому виду, где сразу видно, чаша перед тобой, седло или что-то вырожденное.
История: откуда это взялось?
Термин «квадратичная форма» родился не в оптимизации и не в геометрии, а в теории чисел. Пьер Ферма в XVII веке интересовался, какие целые числа представимы в виде $x^2 + y^2$ или $x^2 + 2y^2$. Жозеф Луи Лагранж в 1770-х годах систематически изучал бинарные формы $ax^2 + bxy + cy^2$ с целыми коэффициентами и разработал алгоритм их «редукции» — приведения к простейшему представителю в классе эквивалентных форм. Карл Фридрих Гаусс довёл эту теорию до совершенства в «Арифметических исследованиях» 1801 года, где строго определил композицию форм и их классы эквивалентности. Показатель того, насколько глубокой оказалась эта на вид элементарная задача: полная теория квадратичных форм над целыми числами создавалась математиками весь XIX век, а некоторые вопросы о представимости чисел формами не закрыты и сегодня.
Параллельно развивалась геометрическая линия. Ещё в античности были известны конические сечения — эллипс, парабола, гипербола, — и уравнения этих кривых на плоскости всегда содержат квадратичную часть $ax^2 + bxy + cy^2$. Задача классификации кривых и поверхностей второго порядка требовала понять, когда квадратичная часть даёт эллипс, а когда гиперболу. Огюстен Луи Коши в том же мемуаре 1829 года, где он доказал вещественность собственных значений симметричных матриц (см. урок 172), фактически завершил эту классификацию: он показал, что знаки собственных значений матрицы квадратичной формы определяют тип кривой или поверхности.
Ключевой практический критерий появился в середине XIX века сразу с двух сторон. Карл Густав Якоб Якоби в работе, опубликованной посмертно в 1857 году, вывел явную формулу: коэффициенты канонического вида формы, полученного методом последовательного исключения переменных, равны отношениям соседних угловых миноров $\Delta_k / \Delta_{k-1}$. Отсюда сразу следует, что форма положительно определена тогда и только тогда, когда все угловые миноры положительны — сегодня это чаще всего называют критерием Сильвестра, хотя исторически точнее было бы говорить о теореме Якоби. Джеймс Джозеф Сильвестр в 1852 году доказал другой фундаментальный факт — закон инерции: сколько бы способов привести квадратичную форму к сумме квадратов ни существовало, число положительных, отрицательных и нулевых коэффициентов в этой сумме всегда одно и то же. Сильвестр назвал эти три числа «инерцией» формы — по аналогии с моментом инерции в механике, физической величиной, тоже задаваемой квадратичной формой и тоже не зависящей от выбора координатных осей.
Само слово «гессиан» — дань уважения Отто Гессе, который в 1858 году, изучая кривые заданные многочленами, ввёл определитель матрицы вторых производных. Название закрепил не сам Гессе, а Джеймс Джозеф Сильвестр — да, тот же самый, — предложивший термин в 1871 году. Спустя полтора века эта матрица вторых производных стала главным инструментом анализа функций потерь в машинном обучении, а критерий Сильвестра — стандартной проверкой того, что найденная точка действительно минимум, а не что-то ещё.
Квадратичная форма: от линейного к квадратичному
Интуиция: чем квадратичная форма отличается от линейной функции
Линейная функция от $n$ переменных — это $f(x) = c_1x_1 + \dots + c_nx_n = c^Tx$, сумма переменных с коэффициентами, каждая переменная входит в первой степени. Её график — плоскость (или гиперплоскость), она либо монотонно растёт вдоль каждого направления, либо монотонно убывает, и нигде не имеет ни минимума, ни максимума на всём пространстве.
Квадратичная форма получается, если разрешить переменным перемножаться друг с другом: $Q(x) = \sum_{i,j} a_{ij} x_i x_j$ — сумма всех возможных попарных произведений $x_ix_j$ (включая $x_i^2 = x_i \cdot x_i$) с какими-то коэффициентами. Никаких слагаемых первой степени, никакой константы — только чистые произведения пар переменных. Именно из-за этого график квадратичной формы от двух переменных — это уже не плоскость, а парабола, чаша, седло или что-то вырожденное: слагаемые второй степени умеют закругляться, а линейные — нет.
Давай разберёмся, как компактно записать такую сумму. Возьми форму от двух переменных $Q(x_1, x_2) = 3x_1^2 + 4x_1x_2 + x_2^2$. Слагаемое $4x_1x_2$ можно мысленно «расщепить» на два одинаковых куска: $4x_1x_2 = 2x_1x_2 + 2x_2x_1$. Тогда
$$Q(x_1,x_2) = 3x_1x_1 + 2x_1x_2 + 2x_2x_1 + 1 \cdot x_2x_2$$и это в точности разворачивается в произведение $x^TAx$ с матрицей
$$A = \begin{pmatrix} 3 & 2 \\ 2 & 1 \end{pmatrix}, \qquad x = \begin{pmatrix} x_1 \\ x_2 \end{pmatrix}$$Проверим: $x^TAx = x^T\begin{pmatrix} 3x_1 + 2x_2 \\ 2x_1 + x_2 \end{pmatrix} = x_1(3x_1+2x_2) + x_2(2x_1+x_2) = 3x_1^2 + 2x_1x_2 + 2x_1x_2 + x_2^2 = 3x_1^2 + 4x_1x_2 + x_2^2$. Сошлось.
Обрати внимание: коэффициент при смешанном произведении $x_1x_2$ мы поровну разделили между $a_{12}$ и $a_{21}$, получив симметричную матрицу. Это не случайность, а соглашение, которое стоит принять раз и навсегда.
Определение
Определение: Пусть $A$ — квадратная симметричная матрица порядка $n$ ($A^T = A$). Квадратичной формой от переменных $x_1, \dots, x_n$ называется функция
$$Q(x) = x^TAx = \sum_{i=1}^n\sum_{j=1}^n a_{ij}x_ix_j = \sum_{i=1}^n a_{ii}x_i^2 + 2\sum_{iМатрица $A$ называется матрицей квадратичной формы. Диагональные элементы $a_{ii}$ — коэффициенты при $x_i^2$, а внедиагональные $a_{ij} = a_{ji}$ ($i \ne j$) равны половине коэффициента при смешанном произведении $x_ix_j$.
Почему матрица берётся именно симметричной, а не любой? Потому что можно доказать: любую (не обязательно симметричную) матрицу $B$ можно заменить на симметричную $A = \tfrac12(B + B^T)$, и квадратичная форма при этом не изменится ни на йоту — $x^TBx = x^TAx$ для всех $x$. Раз результат один и тот же, а работать с симметричной матрицей строго удобнее (для неё, как ты знаешь из урока 172, гарантированы вещественные собственные значения), симметричность матрицы квадратичной формы принимается как соглашение по умолчанию. Проверим это на примере ниже.
Разбор примеров
Пример 1 (лёгкий). От многочлена к матрице.
Дана форма $Q(x_1,x_2,x_3) = x_1^2 + 2x_2^2 + 3x_3^2 + 2x_1x_2 - 4x_1x_3 + 6x_2x_3$. Найдём её матрицу.
На диагональ идут коэффициенты при квадратах: $a_{11} = 1$, $a_{22} = 2$, $a_{33} = 3$. Внедиагональные элементы — половины коэффициентов при смешанных произведениях: коэффициент при $x_1x_2$ равен $2$, значит $a_{12} = 1$; коэффициент при $x_1x_3$ равен $-4$, значит $a_{13} = -2$; коэффициент при $x_2x_3$ равен $6$, значит $a_{23} = 3$.
$$A = \begin{pmatrix} 1 & 1 & -2 \\ 1 & 2 & 3 \\ -2 & 3 & 3 \end{pmatrix}$$Проверка обратным разворачиванием: $x^TAx = x_1^2 + 2x_2^2 + 3x_3^2 + 2(1)x_1x_2 + 2(-2)x_1x_3 + 2(3)x_2x_3$, что даёт ровно исходный многочлен.
Пример 2 (средний). От матрицы к многочлену.
Дана матрица $A = \begin{pmatrix} 3 & 2 \\ 2 & -1 \end{pmatrix}$. Восстановим форму: диагональ читается напрямую, внедиагональный элемент удваивается.
$$Q(x_1,x_2) = 3x_1^2 + 2\cdot 2\, x_1x_2 + (-1)x_2^2 = 3x_1^2 + 4x_1x_2 - x_2^2$$Это упражнение — простое, но именно на нём чаще всего теряют множитель 2, забывая, что в матрице стоит половина коэффициента.
Пример 3 (сложный). Несимметричная матрица даёт ту же форму.
Возьмём заведомо несимметричную $B = \begin{pmatrix} 1 & 3 \\ -1 & 2 \end{pmatrix}$ и явно посчитаем $x^TBx$:
$$x^TBx = x_1(x_1 + 3x_2) + x_2(-x_1 + 2x_2) = x_1^2 + 3x_1x_2 - x_1x_2 + 2x_2^2 = x_1^2 + 2x_1x_2 + 2x_2^2$$Слагаемые $3x_1x_2$ и $-x_1x_2$ сложились в $2x_1x_2$ — асимметрия матрицы просто «схлопнулась», потому что $x_2x_1$ и $x_1x_2$ как числа совпадают. Теперь симметризуем: $A = \tfrac12(B+B^T) = \tfrac12\begin{pmatrix} 2 & 2 \\ 2 & 4 \end{pmatrix} = \begin{pmatrix} 1 & 1 \\ 1 & 2 \end{pmatrix}$. Проверка: $x^TAx = x_1^2 + 2x_1x_2 + 2x_2^2$ — та же самая форма. Кожносимметричная часть матрицы ($\tfrac12(B - B^T)$) на квадратичную форму вообще не влияет: попробуй убедиться, что для антисимметричной $C$ (то есть $C^T = -C$) всегда $x^TCx = 0$.
Почему это важно
Матричная запись — не эстетическая прихоть, а способ подключить к квадратичным формам весь аппарат линейной алгебры: определители, ранг, собственные значения. В машинном обучении это работает буквально: гессиан дважды дифференцируемой функции $f(x)$ — это симметричная матрица вторых производных $H_{ij} = \partial^2 f / \partial x_i \partial x_j$ (симметричность гарантирует теорема Шварца о равенстве смешанных производных), и квадратичный член ряда Тейлора вблизи точки $x_0$ имеет вид ровно $\tfrac12 (x-x_0)^T H (x-x_0)$ — квадратичная форма с матрицей $H$. Всё, что мы про формы узнаем дальше, автоматически становится инструментом анализа гессиана.
Знакоопределённость: пять типов квадратичных форм
Интуиция: чаша, перевёрнутая чаша, седло
Квадратичная форма от $n$ переменных всегда обращается в ноль при $x = \mathbf{0}$: подставь нулевой вектор — получишь ноль. Вопрос в том, что происходит при всех остальных $x$: форма может оставаться всегда неотрицательной (чаша с дном в начале координат), всегда неположительной (перевёрнутая чаша), может пересекать ноль в обе стороны (седло) или же обращаться в ноль не только в начале координат, а вдоль целого направления (вырожденный случай — «желоб» вместо чаши).
Представь, что ты стоишь в начале координат на графике $Q(x_1, x_2)$. Если в какую сторону ни шагни, высота только растёт — это чаша, форма положительно определена. Если высота только падает — перевёрнутая чаша, форма отрицательно определена. Если в одну сторону растёт, а в перпендикулярную падает — седло, форма знакопеременная (индефинитная). А бывает промежуточный случай: высота никогда не становится отрицательной, но вдоль одного особого направления она равна нулю, как дно узкого жёлоба, а не одной точки — форма положительно полуопределена.
Определение
Определение: Пусть $Q(x) = x^TAx$ — квадратичная форма от $n$ переменных. Она называется:
- положительно определённой, если $Q(x) > 0$ для всех $x \ne \mathbf{0}$;
- отрицательно определённой, если $Q(x) < 0$ для всех $x \ne \mathbf{0}$;
- положительно полуопределённой, если $Q(x) \ge 0$ для всех $x$ (и есть $x \ne \mathbf{0}$ с $Q(x) = 0$);
- отрицательно полуопределённой, если $Q(x) \le 0$ для всех $x$ (и есть $x \ne \mathbf{0}$ с $Q(x) = 0$);
- знакопеременной (индефинитной), если найдутся $x, y$ такие, что $Q(x) > 0$, а $Q(y) < 0$.
Те же термины применяют и к самой симметричной матрице $A$: пишут $A \succ 0$ для положительно определённой, $A \succeq 0$ для положительно полуопределённой и так далее.
Первые два типа называют знакоопределёнными, все пять вместе исчерпывают все возможные квадратичные формы — третьего не дано, любая форма попадает ровно в один из этих пяти классов.
Разбор примеров
Классический ручной способ определить тип формы, не прибегая пока ни к каким критериям, — метод Лагранжа: выделить полные квадраты, как ты выделял их при решении квадратных уравнений в школе, только теперь с несколькими переменными.
Пример 1 (лёгкий). Положительно определённая форма через выделение квадрата.
$$Q(x_1,x_2) = 2x_1^2 - 2x_1x_2 + x_2^2$$Собираем все слагаемые с $x_1$ в один полный квадрат:
$$Q = 2\left(x_1^2 - x_1x_2\right) + x_2^2 = 2\left(x_1 - \tfrac12 x_2\right)^2 - 2\cdot\tfrac14 x_2^2 + x_2^2 = 2\left(x_1 - \tfrac12 x_2\right)^2 + \tfrac12 x_2^2$$Оба коэффициента (2 и $\tfrac12$) положительны, а квадраты обращаются в ноль одновременно только при $x_1 = x_2 = 0$ (второе слагаемое даёт $x_2 = 0$, первое при этом даёт $x_1 = 0$). Значит, $Q(x) > 0$ при любом $x \ne \mathbf{0}$ — форма положительно определена.
Пример 2 (средний). Знакопеременная форма.
$$Q(x_1, x_2) = x_1^2 + 4x_1x_2 + x_2^2$$$$Q = \left(x_1 + 2x_2\right)^2 - 4x_2^2 + x_2^2 = \left(x_1+2x_2\right)^2 - 3x_2^2$$Знаки коэффициентов разные ($+1$ и $-3$). Подставим $x_2 = 0, x_1 = 1$: $Q = 1 > 0$. Подставим $x_1 = -2, x_2 = 1$ (обнуляет первый квадрат): $Q = 0 - 3 = -3 < 0$. Форма принимает значения обоих знаков — знакопеременная.
Пример 3 (сложный). Трёхдиагональная форма — положительная определённость в три шага.
$$Q(x_1,x_2,x_3) = 2x_1^2 + 2x_2^2 + 2x_3^2 - 2x_1x_2 - 2x_2x_3$$(это форма матрицы $A = \begin{pmatrix} 2 & -1 & 0 \\ -1 & 2 & -1 \\ 0 & -1 & 2 \end{pmatrix}$ — трёхдиагональной матрицы, которая будет постоянно всплывать дальше в уроке). Выделяем квадрат по $x_1$:
$$Q = 2\left(x_1^2 - x_1x_2\right) + 2x_2^2 - 2x_2x_3 + 2x_3^2 = 2\left(x_1 - \tfrac12x_2\right)^2 - \tfrac12x_2^2 + 2x_2^2 - 2x_2x_3 + 2x_3^2$$$$= 2\left(x_1 - \tfrac12x_2\right)^2 + \tfrac32x_2^2 - 2x_2x_3 + 2x_3^2$$Теперь выделяем квадрат по $x_2$ в оставшихся членах: $\tfrac32x_2^2 - 2x_2x_3 = \tfrac32\left(x_2^2 - \tfrac43x_2x_3\right) = \tfrac32\left(x_2 - \tfrac23x_3\right)^2 - \tfrac32\cdot\tfrac49x_3^2 = \tfrac32\left(x_2-\tfrac23x_3\right)^2 - \tfrac23x_3^2$.
$$Q = 2\left(x_1-\tfrac12x_2\right)^2 + \tfrac32\left(x_2-\tfrac23x_3\right)^2 - \tfrac23x_3^2 + 2x_3^2 = 2\left(x_1-\tfrac12x_2\right)^2 + \tfrac32\left(x_2-\tfrac23x_3\right)^2 + \tfrac43x_3^2$$Три коэффициента — $2$, $\tfrac32$, $\tfrac43$ — все строго положительны. Форма положительно определена. Такая трёхдиагональная матрица (2 на диагонали, $-1$ по соседним позициям) — не абстрактная выдумка: это дискретный аналог второй производной, и матрицы такого вида регулярно используются как штраф за негладкость в регуляризации (сглаживающие сплайны, штрафы на разности соседних весов).
Почему это важно
Именно знакоопределённость решает судьбу критической точки функции. Если гессиан функции в стационарной точке (там, где градиент равен нулю) положительно определён — это строгий локальный минимум. Отрицательно определён — строгий локальный максимум. Знакопеременный — седловая точка, и градиентный спуск может застревать возле неё бесконечно долго, потому что градиент почти нулевой, а спуститься дальше можно, просто путь к этому неочевиден без учёта кривизны. Мы разберём это подробно в разделе про машинное обучение.
Критерий Сильвестра: определённость по угловым минорам
Интуиция: зачем считать миноры, если можно перебрать все $x$
Метод Лагранжа из предыдущего раздела работает, но требует выделять полные квадраты вручную — при росте числа переменных это утомительно и легко ошибиться. Критерий Сильвестра сводит всю проверку к вычислению нескольких определителей, каждый из которых ты уже умеешь считать из уроков про определители.
Угловой (главный) минор порядка $k$ матрицы $A$ — это определитель подматрицы, полученной вычёркиванием всех строк и столбцов с номерами больше $k$, то есть определитель левого верхнего блока $k \times k$. Обозначим его $\Delta_k$.
Определение
Критерий Сильвестра. Пусть $A$ — симметричная матрица порядка $n$, $\Delta_1, \dots, \Delta_n$ — её угловые миноры.
- $A$ положительно определена тогда и только тогда, когда все угловые миноры положительны: $\Delta_1 > 0,\ \Delta_2 > 0,\ \dots,\ \Delta_n > 0$.
- $A$ отрицательно определена тогда и только тогда, когда угловые миноры чередуют знак, начиная с отрицательного: $\Delta_1 < 0,\ \Delta_2 > 0,\ \Delta_3 < 0,\ \dots$, то есть $(-1)^k\Delta_k > 0$ для всех $k$.
Если ни одно из этих двух условий не выполнено (в частности, если какой-то $\Delta_k = 0$ или знаки нарушают требуемый шаблон), форма не является ни положительно, ни отрицательно определённой — но может оказаться полуопределённой или знакопеременной. Для этих случаев критерий по угловым минорам не даёт прямого ответа: нужно смотреть на все главные миноры (не только угловые) или переходить к собственным значениям.
Эта оговорка — не техническая деталь, а частый источник ошибок, и мы отдельно разберём её в разделе про частые ошибки.
Разбор примеров
Пример 1 (лёгкий).
$$A = \begin{pmatrix} 2 & -1 \\ -1 & 1 \end{pmatrix}$$$\Delta_1 = 2 > 0$. $\Delta_2 = \det A = 2\cdot 1 - (-1)(-1) = 2 - 1 = 1 > 0$. Оба минора положительны — форма положительно определена. Это ровно матрица из первого примера предыдущего раздела: там методом Лагранжа мы получили $2(x_1-\tfrac12x_2)^2 + \tfrac12x_2^2$, оба коэффициента положительны — два разных метода дали одинаковый ответ, как и должно быть.
Пример 2 (средний). Трёхдиагональная матрица.
$$A = \begin{pmatrix} 2 & -1 & 0 \\ -1 & 2 & -1 \\ 0 & -1 & 2 \end{pmatrix}$$$\Delta_1 = 2 > 0$. $\Delta_2 = \det\begin{pmatrix}2 & -1\\-1&2\end{pmatrix} = 4 - 1 = 3 > 0$. Для $\Delta_3$ раскладываем определитель $3\times3$ по первой строке:
$$\Delta_3 = 2(2\cdot2 - (-1)(-1)) - (-1)((-1)\cdot2 - (-1)\cdot0) + 0 = 2(4-1) + 1\cdot(-2) = 6 - 2 = 4$$Все три минора ($2, 3, 4$) положительны — форма положительно определена. Снова совпадает с результатом, который метод Лагранжа дал для этой же матрицы: три положительных коэффициента $2, \tfrac32, \tfrac43$.
Пример 3 (сложный). Форма с параметром.
При каких значениях $t$ матрица положительно определена?
$$A(t) = \begin{pmatrix} 1 & 1 & 0 \\ 1 & t & 1 \\ 0 & 1 & 1 \end{pmatrix}$$$\Delta_1 = 1 > 0$ всегда. $\Delta_2 = \det\begin{pmatrix}1&1\\1&t\end{pmatrix} = t - 1$; условие $\Delta_2 > 0$ даёт $t > 1$.
$$\Delta_3 = 1\cdot(t\cdot1 - 1\cdot1) - 1\cdot(1\cdot1 - 1\cdot0) + 0 = (t - 1) - 1 = t - 2$$Условие $\Delta_3 > 0$ даёт $t > 2$. Пересекая оба условия ($t > 1$ и $t > 2$), получаем ответ: матрица положительно определена при $t > 2$. Обрати внимание, что более слабое условие $t>1$ полностью поглощается более сильным — при решении задач с параметром всегда бери пересечение всех условий, а не только последнее.
Почему это важно
Критерий Сильвестра — это ровно то, что происходит внутри проверки на выпуклость: если у тебя есть аналитическое выражение для гессиана функции потерь (не просто численная матрица, а формула с параметрами модели), угловые миноры дают явные неравенства на эти параметры, при которых функция гарантированно выпукла. Именно так на бумаге доказывают, что регуляризованная линейная регрессия имеет единственный минимум при любом положительном коэффициенте регуляризации — вычислением одного определителя, без перебора всех возможных весов.
Канонический вид и закон инерции: диагонализация через собственные значения
Интуиция: поворот системы координат, где форма становится суммой квадратов
Метод Лагранжа даёт сумму квадратов, но коэффициенты в ней зависят от порядка, в котором ты выделял переменные — попробуй другой порядок, получишь другие числа (хотя и с тем же набором знаков, как мы увидим). Есть один особый способ привести форму к сумме квадратов — не произвольная замена переменных, а переход к базису из собственных векторов матрицы $A$. Поскольку $A$ симметрична, по теореме, которую мы полноценно докажем в уроке 175 (спектральная теорема), у неё существует ортонормированный базис из собственных векторов. Это значит, что подстановка $x = Cy$, где столбцы $C$ — единичные попарно перпендикулярные собственные векторы $A$, переводит форму в сумму квадратов с самими собственными значениями в роли коэффициентов:
$$Q(x) = x^TAx = (Cy)^TA(Cy) = y^T(C^TAC)y = y^T\Lambda y = \lambda_1y_1^2 + \dots + \lambda_ny_n^2$$Это и есть канонический вид формы. Он не просто сумма квадратов — это самая информативная сумма квадратов, потому что её коэффициенты — конкретные собственные значения матрицы, а направления новых осей $y_1, \dots, y_n$ — это её собственные векторы, те самые «главные оси», о которых шла речь в уроке про диагонализацию.
Определение
Определение: Каноническим видом квадратичной формы $Q(x) = x^TAx$ называется представление $Q = \lambda_1y_1^2 + \dots + \lambda_ny_n^2$, полученное подстановкой $x = Cy$, где $C$ — ортогональная матрица, столбцы которой — собственные векторы $A$, а $\lambda_1, \dots, \lambda_n$ — соответствующие собственные значения (с учётом кратности).
Закон инерции Сильвестра: число положительных, отрицательных и нулевых коэффициентов в любом приведении формы к сумме квадратов (не обязательно каноническом — методом Лагранжа с любым порядком переменных тоже) всегда одно и то же. Эту тройку чисел $(p, q, z)$, $p+q+z=n$, называют сигнатурой формы.
Отсюда прямое следствие для классификации: форма положительно определена тогда и только тогда, когда все собственные значения матрицы положительны; отрицательно определена — когда все отрицательны; положительно (отрицательно) полуопределена — когда все собственные значения неотрицательны (неположительны), но хотя бы одно равно нулю; знакопеременна — когда среди собственных значений есть и положительные, и отрицательные.
Разбор примеров
Пример 1 (средний). Полное приведение к каноническому виду с проверкой закона инерции.
Возьмём форму из примера 2 предыдущего раздела: $A = \begin{pmatrix} 1 & 2 \\ 2 & 1\end{pmatrix}$, $Q = x_1^2 + 4x_1x_2 + x_2^2$. Найдём собственные значения: $\operatorname{tr}A = 2$, $\det A = 1 - 4 = -3$, характеристическое уравнение $\lambda^2 - 2\lambda - 3 = 0 = (\lambda-3)(\lambda+1)$, корни $\lambda_1 = 3$, $\lambda_2 = -1$.
Собственный вектор для $\lambda_1=3$: $(A-3I)v=0 \Rightarrow \begin{pmatrix}-2&2\\2&-2\end{pmatrix}v=0 \Rightarrow v_1 = (1,1)^T$. Для $\lambda_2=-1$: $(A+I)v=0 \Rightarrow \begin{pmatrix}2&2\\2&2\end{pmatrix}v=0 \Rightarrow v_2=(1,-1)^T$. Нормируем: $\tfrac{1}{\sqrt2}(1,1)^T$ и $\tfrac1{\sqrt2}(1,-1)^T$, отсюда $x_1 = \tfrac{y_1+y_2}{\sqrt2}$, $x_2 = \tfrac{y_1-y_2}{\sqrt2}$.
Подставим напрямую: $x_1^2 + x_2^2 = \tfrac{(y_1+y_2)^2 + (y_1-y_2)^2}{2} = y_1^2+y_2^2$, а $x_1x_2 = \tfrac{(y_1+y_2)(y_1-y_2)}{2} = \tfrac{y_1^2-y_2^2}{2}$. Тогда
$$Q = (y_1^2+y_2^2) + 4\cdot\tfrac{y_1^2-y_2^2}{2} = y_1^2+y_2^2 + 2y_1^2-2y_2^2 = 3y_1^2 - y_2^2$$Это в точности канонический вид с коэффициентами-собственными значениями $3$ и $-1$. Сравним с результатом метода Лагранжа из прошлого раздела: там мы получили $(x_1+2x_2)^2 - 3x_2^2$ — коэффициенты $1$ и $-3$, совсем другие числа! Но сигнатура одна и та же в обоих случаях: один положительный коэффициент, один отрицательный. Это и есть закон инерции в действии: метод разный, числа разные, а знаковый состав — неизменен.
Пример 2 (средний). Каноническая форма 3×3 с кратным собственным значением.
$$A = \begin{pmatrix} 2 & 1 & 1 \\ 1 & 2 & 1 \\ 1 & 1 & 2\end{pmatrix}$$Заметим, что $A = I + J$, где $J$ — матрица из одних единиц. У $J$ след равен $3$, а поскольку $J^2 = 3J$ (каждый элемент произведения — сумма трёх единиц), собственные значения $J$ удовлетворяют $\lambda^2=3\lambda$, то есть равны $3$ (кратности 1) и $0$ (кратности 2). Тогда у $A = I+J$ собственные значения $1+3=4$ и $1+0=1$ (кратности 2). Проверка следом: $4+1+1=6=\operatorname{tr}A$ ($2+2+2$); проверка определителем: $4\cdot1\cdot1=4$, а прямым вычислением $\det A = 2(4-1)-1(2-1)+1(1-2) = 6-1-1=4$ — сходится.
Канонический вид: $Q = 4y_1^2 + y_2^2 + y_3^2$. Все коэффициенты положительны — форма положительно определена, что согласуется с угловыми минорами $2, 3, 4$ (проверь самостоятельно по той же схеме, что и в примере 2 предыдущего раздела).
Пример 3 (сложный). От квадратичной формы к классификации кривой на плоскости.
Квадратичные формы напрямую классифицируют кривые второго порядка. Дано уравнение $5x_1^2 - 4x_1x_2 + 8x_2^2 = 36$. Матрица формы $A = \begin{pmatrix}5 & -2\\-2&8\end{pmatrix}$: $\operatorname{tr}A=13$, $\det A = 40-4=36$, характеристическое уравнение $\lambda^2-13\lambda+36=0=(\lambda-4)(\lambda-9)$, собственные значения $4$ и $9$.
В координатах собственных векторов уравнение превращается в $4y_1^2 + 9y_2^2 = 36$, то есть
$$\frac{y_1^2}{9} + \frac{y_2^2}{4} = 1$$Это уравнение эллипса с полуосями $3$ и $2$, повёрнутого относительно исходных осей $x_1, x_2$ на угол, задаваемый собственными векторами. Оба собственных значения положительны — исходная форма положительно определена, и именно поэтому уравнение $Q(x) = c > 0$ задаёт замкнутую кривую (эллипс), а не гиперболу. Если бы одно собственное значение было отрицательным, та же логика дала бы уравнение гиперболы.
Почему это важно
Переход к каноническому виду через собственные значения — это ровно то, что делает PCA с ковариационной матрицей: находит направления (собственные векторы), вдоль которых данные растянуты сильнее и слабее всего (собственные значения), и переписывает всё в координатах этих направлений, где корреляции между новыми переменными исчезают. Закон инерции при этом даёт спокойствие иного рода: какой бы численный метод диагонализации библиотека ни использовала внутри, ответ на вопрос «выпукла ли эта функция» не зависит от деталей вычислений — знаки не меняются.
Квадратичные формы в машинном обучении
Гессиан и выпуклость функции потерь
Для дважды дифференцируемой функции $f: \mathbb{R}^n \to \mathbb{R}$ гессиан $H(x)$ — симметричная матрица вторых производных. Стандартный факт математического анализа: если $H(x) \succeq 0$ (положительно полуопределён) во всех точках области, функция выпукла; если $H(x) \succ 0$ всюду — функция строго выпукла. А в стационарной точке $x^*$ (где градиент равен нулю) знакоопределённость гессиана классифицирует саму точку: $H(x^*)\succ0$ — строгий локальный минимум, $H(x^*)\prec0$ — строгий локальный максимум, $H(x^*)$ знакопеременна — седловая точка.
Пример: пусть функция потерь имеет вид $L(w_1,w_2) = w_1^2 + 4w_1w_2 + 5w_2^2$. Гессиан для квадратичной функции постоянен: $H = \begin{pmatrix}2&4\\4&10\end{pmatrix}$ (вторые производные: $L_{w_1w_1}=2$, $L_{w_1w_2}=4$, $L_{w_2w_2}=10$). По критерию Сильвестра: $\Delta_1=2>0$, $\Delta_2 = 20-16=4>0$ — гессиан положительно определён всюду, значит $L$ строго выпукла и имеет единственный глобальный минимум.
Важная деталь, о которой часто забывают: положительная полуопределённость гессиана даёт выпуклость, но не гарантирует единственность минимума. Пусть $L(w_1,w_2) = w_1^2 - 2w_1w_2 + w_2^2 + w_1 = (w_1-w_2)^2 + w_1$. Гессиан $H = \begin{pmatrix}2&-2\\-2&2\end{pmatrix}$: $\operatorname{tr}H=4$, $\det H=4-4=0$, собственные значения $4$ и $0$ — полуопределён, но не определён. Вдоль направления $w_1=w_2$ квадратичный член исчезает и остаётся линейный $w_1$ — функция вдоль этого направления не имеет минимума вовсе (уходит в $-\infty$). Это ровно та ситуация, когда параметры модели «не идентифицируемы»: данных недостаточно, чтобы однозначно определить веса, и регуляризация (добавление $\varepsilon(w_1^2+w_2^2)$) — стандартный способ восстановить строгую выпуклость.
Ковариационная матрица всегда положительно полуопределена
Это один из самых красивых фактов на стыке линейной алгебры и статистики, и доказывается он в одну строку. Пусть $\Sigma = \mathbb{E}[(X-\mu)(X-\mu)^T]$ — ковариационная матрица случайного вектора $X$. Для любого вектора $a$:
$$a^T\Sigma a = a^T\mathbb{E}[(X-\mu)(X-\mu)^T]a = \mathbb{E}[a^T(X-\mu)(X-\mu)^Ta] = \mathbb{E}\left[\left(a^T(X-\mu)\right)^2\right] \ge 0$$Последнее выражение — математическое ожидание квадрата случайной величины, а квадрат вещественного числа неотрицателен всегда. Значит $a^T\Sigma a \ge 0$ для любого $a$ — по определению это и есть положительная полуопределённость, причём это верно для любых данных, без каких-либо предположений об их распределении. Строгая положительная определённость появляется дополнительно, если ни одна линейная комбинация признаков не постоянна (нет точной коллинеарности).
Проверим численно. Три центрированных наблюдения двух признаков: $(-1,-1), (0,1), (1,0)$ (сумма по каждой координате равна нулю, значит выборочное среднее уже вычтено). Выборочная ковариация: $\operatorname{Cov}_{11} = \tfrac13(1+0+1)=\tfrac23$, $\operatorname{Cov}_{22}=\tfrac13(1+1+0)=\tfrac23$, $\operatorname{Cov}_{12}=\tfrac13((-1)(-1)+0\cdot1+1\cdot0)=\tfrac13$. Матрица $\Sigma = \begin{pmatrix}2/3&1/3\\1/3&2/3\end{pmatrix}$, или после умножения на положительное число $3$ (что не меняет знакоопределённости): $\begin{pmatrix}2&1\\1&2\end{pmatrix}$. Критерий Сильвестра: $\Delta_1=2>0$, $\Delta_2=4-1=3>0$ — положительно определена, как и предсказывает общее рассуждение.
Регуляризация: почему $X^TX + \lambda I$ всегда положительно определена
В линейной регрессии решение методом наименьших квадратов требует обращения матрицы $X^TX$, которая, по той же логике что и выше (это тоже матрица вида $M^TM$), всегда положительно полуопределена, но может быть вырожденной — например, если признаков больше, чем наблюдений, или два признака линейно зависимы. Гребневая регрессия (ridge, регуляризация Тихонова) добавляет к ней $\lambda I$ с $\lambda>0$.
Пусть $X = \begin{pmatrix}1&0\\0&1\\1&1\end{pmatrix}$ (три наблюдения, два признака). $X^TX = \begin{pmatrix}1+0+1 & 0+0+1\\0+0+1&0+1+1\end{pmatrix} = \begin{pmatrix}2&1\\1&2\end{pmatrix}$, а с регуляризацией $\lambda=2$: $X^TX+2I = \begin{pmatrix}4&1\\1&4\end{pmatrix}$. Критерий Сильвестра: $\Delta_1=4>0$, $\Delta_2=16-1=15>0$ — строго положительно определена. Прибавление $\lambda I$ сдвигает каждое собственное значение на $\lambda$ (см. свойства из урока 172), и даже нулевое собственное значение исходной $X^TX$ становится равным $\lambda>0$ — вырожденность исчезает гарантированно, при любых данных.
Расстояние Махаланобиса
Показатель степени в плотности многомерного нормального распределения содержит квадратичную форму $(x-\mu)^T\Sigma^{-1}(x-\mu)$ — квадрат расстояния Махаланобиса. Поскольку $\Sigma$ положительно определена, обратная матрица $\Sigma^{-1}$ тоже положительно определена (собственные значения обратной — это обратные величины, и они остаются положительными), а значит расстояние Махаланобиса всегда неотрицательно и обращается в ноль только в самой точке $\mu$ — это законное расстояние, не парадокс.
Пример: $\Sigma = \begin{pmatrix}4&0\\0&1\end{pmatrix}$ (признаки некоррелированы, но с разным разбросом), $\Sigma^{-1} = \begin{pmatrix}1/4&0\\0&1\end{pmatrix}$. Расстояние от точки $x=(2,1)$ до среднего в начале координат: $d^2 = 4\cdot\tfrac14 + 1\cdot1 = 1+1=2$, $d=\sqrt2$. Обрати внимание: обычное евклидово расстояние до этой точки равнялось бы $\sqrt{4+1}=\sqrt5$ — расстояние Махаланобиса «сжимает» ось с большим разбросом, потому что отклонение по ней статистически более ожидаемо.
Ньютоновские методы оптимизации
Метод Ньютона делает шаг $x_{k+1} = x_k - H^{-1}\nabla f(x_k)$, и этот шаг гарантированно ведёт к уменьшению функции только тогда, когда $H$ положительно определена — иначе направление шага может указывать в сторону роста функции, а не убывания. Квазиньютоновские методы (BFGS, L-BFGS), широко используемые для обучения моделей, специально поддерживают положительно определённую аппроксимацию гессиана на каждом шаге — это встроенное в алгоритм требование, а не побочная деталь.
Практика: 30 заданий
Базовые задания (1–10)
Задание 1: Запиши матрицу квадратичной формы $Q(x_1,x_2) = 4x_1^2 - 6x_1x_2 + 9x_2^2$.
Задание 2: По матрице $A = \begin{pmatrix}3&2\\2&-1\end{pmatrix}$ восстанови квадратичную форму.
Задание 3: Проверь критерием Сильвестра, положительно ли определена матрица $A = \begin{pmatrix}2&1\\1&3\end{pmatrix}$.
Задание 4: Проверь критерием Сильвестра матрицу $A = \begin{pmatrix}-3&1\\1&-2\end{pmatrix}$.
Задание 5: Определи тип матрицы $A = \begin{pmatrix}1&3\\3&1\end{pmatrix}$.
Задание 6: Является ли диагональная матрица $A = \operatorname{diag}(5, -2, 0)$ положительно полуопределённой?
Задание 7 (ML): Функция потерь $f(x,y) = x^2+y^2$. Найди гессиан и определи тип критической точки $(0,0)$.
Задание 8 (ML): Функция $f(x,y) = x^2 - y^2$. Найди гессиан и определи тип точки $(0,0)$.
Задание 9: Определи тип диагональной матрицы $A = \operatorname{diag}(4, -9)$.
Задание 10: Найди симметричную матрицу, задающую ту же квадратичную форму, что и $B = \begin{pmatrix}2&5\\1&3\end{pmatrix}$.
Средние задания (11–20)
Задание 11: Проверь критерием Сильвестра положительную определённость $A = \begin{pmatrix}4&1&0\\1&3&1\\0&1&2\end{pmatrix}$.
Задание 12: Проверь критерием Сильвестра $A = \begin{pmatrix}-2&1&0\\1&-3&1\\0&1&-2\end{pmatrix}$.
Задание 13: Методом Лагранжа приведи к сумме квадратов и классифицируй $Q = x_1^2+2x_2^2+3x_3^2+2x_1x_2$.
Задание 14: Найди собственные значения и канонический вид формы с матрицей $A=\begin{pmatrix}3&1\\1&3\end{pmatrix}$.
Задание 15: При каких значениях $a$ матрица $A=\begin{pmatrix}a&2\\2&1\end{pmatrix}$ положительно определена?
Задание 16 (ML): Функция потерь $f(x,y)=x^2+4xy+5y^2$. Проверь, выпукла ли она (положительно определён ли гессиан).
Задание 17 (ML): По трём центрированным наблюдениям $(-1,-1)$, $(0,1)$, $(1,0)$ построй выборочную ковариационную матрицу и проверь критерием Сильвестра, что она положительно определена.
Задание 18 (ML): Дизайн-матрица $X=\begin{pmatrix}1&0\\0&1\\1&1\end{pmatrix}$. Вычисли $X^TX + 2I$ и проверь положительную определённость.
Задание 19: Матрица $J$ — все элементы равны $1$, размер $3\times3$. Найди её собственные значения и классифицируй форму.
Задание 20: Классифицируй форму с матрицей $A=\begin{pmatrix}1&-2\\-2&4\end{pmatrix}$.
Продвинутые задания (21–30)
Задание 21: При каких $t$ матрица $A=\begin{pmatrix}2&t&0\\t&2&t\\0&t&2\end{pmatrix}$ положительно определена?
Задание 22: Найди канонический вид и сигнатуру формы с матрицей $A=\begin{pmatrix}0&1&1\\1&0&1\\1&1&0\end{pmatrix}$.
Задание 23: Классифицируй кривую $2x_1^2+2x_1x_2+2x_2^2=6$, приведя форму к каноническому виду.
Задание 24 (ловушка Сильвестра): Матрица $A=\begin{pmatrix}0&0\\0&-3\end{pmatrix}$. Можно ли по угловым минорам сразу сказать, что форма отрицательно полуопределена?
Задание 25 (ML): Функция потерь $L(w_1,w_2)=w_1^2-2w_1w_2+w_2^2+w_1$. Проверь выпуклость и определи, единственный ли у неё минимум.
Задание 26 (общий случай): Покажи, что при $a>0$ форма $Q(x_1,x_2)=ax_1^2+2bx_1x_2+\dfrac{b^2}{a}x_2^2$ положительно полуопределена при любом $b$.
Задание 27 (ML): Ковариационная матрица $\Sigma=\begin{pmatrix}4&0\\0&1\end{pmatrix}$. Найди расстояние Махаланобиса от точки $x=(2,1)$ до среднего в начале координат и сравни с евклидовым.
Задание 28 (лайфхак-синтез): Проверь критерием Сильвестра $A=\begin{pmatrix}5&2&0\\2&6&2\\0&2&7\end{pmatrix}$ и заодно проверь её на диагональное преобладание.
Задание 29 (второй дифференциал): Функция $f(x,y)=-2x^2-3y^2+2xy-5$ имеет критическую точку $(0,0)$. Определи её тип.
Задание 30 (капстоун): Форма $Q(x,y,z)=(x-y)^2+(y-z)^2+(z-x)^2$ — квадратичная форма матрицы Лапласиана треугольного графа $A=\begin{pmatrix}2&-1&-1\\-1&2&-1\\-1&-1&2\end{pmatrix}$. Проверь угловые миноры, найди собственные значения и объясни, почему форма неотрицательна, хотя определитель матрицы равен нулю.
Частые ошибки
Ошибка 1. Забывают делить пополам коэффициент при смешанном произведении.
Как выглядит: для $Q=5x_1^2+6x_1x_2+x_2^2$ записывают $a_{12}=6$ вместо $3$.
Почему возникает: коэффициент при $x_i^2$ переносится в матрицу без изменений, и по аналогии кажется, что с $x_ix_j$ нужно поступать так же.
Как правильно: коэффициент при $x_ix_j$ ($i\ne j$) в развёрнутом виде — это $2a_{ij}$, потому что слагаемое встречается дважды: как $a_{ij}x_ix_j$ и как $a_{ji}x_jx_i$. Значит в матрицу идёт половина коэффициента многочлена.
Ошибка 2. Путают положительную полуопределённость с положительной определённостью.
Как выглядит: видят $Q(x)\ge0$ и делают вывод «форма положительно определена», не проверив, обращается ли она в ноль на ненулевых векторах.
Почему возникает: приставка «полу-» кажется несущественной деталью.
Как правильно: определённость требует строгого неравенства $Q(x)>0$ при всех $x\ne\mathbf{0}$. Если найдётся хоть один ненулевой вектор, на котором $Q=0$, форма только полуопределена — как в задаче 20, где $Q=(x_1-2x_2)^2$ обнуляется вдоль целой прямой.
Ошибка 3. Думают, что критерий Сильвестра по угловым минорам напрямую переносится на полуопределённость.
Как выглядит: видят $\Delta_1\ge0,\dots,\Delta_n\ge0$ и заключают «форма положительно полуопределена».
Почему возникает: естественное (но неверное) обобщение строгого критерия на нестрогий случай.
Как правильно: для полуопределённости неотрицательности одних только угловых миноров недостаточно — нужно проверять неотрицательность всех главных миноров (любых, не только левых верхних). Задача 24 — явный контрпример: у отрицательно полуопределённой матрицы оба угловых минора равны нулю, то есть формально неотрицательны, и наивное применение правила дало бы неверный вывод.
Ошибка 4. Судят о знакоопределённости по одним диагональным элементам матрицы.
Как выглядит: «на диагонали стоят положительные числа — форма положительно определена».
Почему возникает: диагональ действительно даёт коэффициенты при чистых квадратах $x_i^2$, и кажется, что этого достаточно.
Как правильно: положительность диагонали — необходимое, но не достаточное условие. У матрицы $\begin{pmatrix}1&3\\3&1\end{pmatrix}$ из задачи 5 диагональ вся положительна, но форма всё равно знакопеременная — большой внедиагональный элемент способен «перевесить» положительную диагональ. Нужен полноценный критерий: угловые миноры или собственные значения.
Ошибка 5. Путают знак в критерии для отрицательной определённости.
Как выглядит: требуют $\Delta_k<0$ для всех $k$ вместо чередования знаков.
Почему возникает: переносят по аналогии правило для положительной определённости («все одного знака»).
Как правильно: для отрицательной определённости знаки должны чередоваться, начиная с отрицательного: $\Delta_1<0,\Delta_2>0,\Delta_3<0,\dots$ Самый надёжный способ не путаться — проверить положительную определённость матрицы $-A$ вместо запоминания шаблона знаков (см. лайфхак 5).
Ошибка 6. Считают, что коэффициенты канонического вида, полученные методом Лагранжа, должны совпадать с собственными значениями.
Как выглядит: сравнивают числа из выделения квадратов (например, $1$ и $-3$) с числами, которые дают собственные значения (например, $3$ и $-1$), и решают, что где-то ошиблись.
Почему возникает: оба метода называются «приведением к сумме квадратов», и кажется, что результат должен быть единственным.
Как правильно: совпадать обязана только сигнатура — число положительных, отрицательных и нулевых коэффициентов (закон инерции Сильвестра). Сами числа зависят от метода и от порядка переменных при выделении квадратов. В примере 1 раздела про канонический вид оба метода дали ровно одну положительную и одну отрицательную компоненту, хотя конкретные коэффициенты были разными.
Ошибка 7. Применяют критерий Сильвестра к несимметричной матрице.
Как выглядит: берут произвольную (не обязательно симметричную) матрицу и сразу считают угловые миноры.
Почему возникает: формула для $\Delta_k$ формально применима к любой квадратной матрице.
Как правильно: знакоопределённость как понятие для квадратичной формы определена только через симметричную матрицу; критерий Сильвестра доказан именно для симметричного случая. Если матрица несимметрична, сначала нужно перейти к $A=\tfrac12(B+B^T)$ и работать уже с ней.
Ошибка 8 (ML). Путают выпуклость с существованием единственного минимума.
Как выглядит: «гессиан положительно полуопределён всюду, значит функция имеет единственный минимум».
Почему возникает: на практике чаще встречаются строго выпуклые функции, и различие стирается.
Как правильно: положительная полуопределённость гессиана даёт лишь выпуклость — множество минимумов может быть пустым (см. задачу 25, где функция вообще не ограничена снизу) или состоять из целой прямой/плоскости. За единственность минимума отвечает строгая положительная определённость (или дополнительные условия вроде компактности множества допустимых значений).
Главное запомнить
-
Определение: квадратичная форма $Q(x)=x^TAx$ строится по симметричной матрице $A$; диагональные элементы — коэффициенты при $x_i^2$, внедиагональные — половина коэффициента при $x_ix_j$.
-
Любую (не обязательно симметричную) матрицу $B$ можно заменить на симметричную $A=\tfrac12(B+B^T)$ без изменения формы — поэтому симметричность матрицы формы берётся как соглашение, а не ограничение.
-
Пять типов знакоопределённости: положительно/отрицательно определённая ($Q>0$ / $Q<0$ при всех $x\ne\mathbf0$), положительно/отрицательно полуопределённая ($Q\ge0$ / $Q\le0$, с обнулением на ненулевых векторах), знакопеременная (значения обоих знаков).
-
Критерий Сильвестра: положительная определённость $\iff$ все угловые миноры $\Delta_1,\dots,\Delta_n$ положительны; отрицательная определённость $\iff$ знаки чередуются, начиная с отрицательного: $(-1)^k\Delta_k>0$.
-
Критерий по угловым минорам работает только для строгой определённости. Для полуопределённости нужны неотрицательность/неположительность всех главных миноров, а не только угловых.
-
Канонический вид $Q=\lambda_1y_1^2+\dots+\lambda_ny_n^2$ получается переходом к базису из собственных векторов симметричной матрицы; знаки собственных значений полностью определяют тип формы.
-
Закон инерции Сильвестра: сигнатура (число положительных, отрицательных и нулевых коэффициентов в сумме квадратов) не зависит от способа приведения — хоть методом Лагранжа, хоть через собственные значения.
-
Метод Лагранжа (последовательное выделение полных квадратов) и метод собственных значений — два разных пути к сумме квадратов; коэффициенты будут разными числами, но одинаковой сигнатуры.
-
В ML: гессиан положительно определён в точке минимума, отрицательно определён в точке максимума, знакопеременен в седловой точке; положительная полуопределённость гессиана всюду даёт выпуклость, но не гарантирует единственность минимума.
-
Ковариационная матрица $\Sigma=\mathbb{E}[(X-\mu)(X-\mu)^T]$ всегда положительно полуопределена — это следует напрямую из $a^T\Sigma a=\mathbb{E}[(a^T(X-\mu))^2]\ge0$, без каких-либо условий на данные. Регуляризация $X^TX+\lambda I$ гарантированно положительно определена при $\lambda>0$.
Связь с другими темами курса
Что нужно было знать до этого урока
Матричная запись формы $Q(x)=x^TAx$ опирается на умножение матриц (уроки 157 и далее) и на вычисление определителей, без которого не посчитать угловые миноры (уроки 158–160). Ранг матрицы (урок 162) нужен, чтобы отличать положительно определённые формы от полуопределённых по рангу матрицы. Но главный фундамент — это уроки 172 и 173: собственные значения и собственные векторы дают сам механизм канонического вида, а гарантия вещественности спектра симметричной матрицы, о которой шла речь в уроке 172, — это ровно то, что позволяет говорить о знаках собственных значений вообще без оговорок про комплексные числа.
Что изучить дальше
Урок 175 «Евклидово пространство» докажет спектральную теорему в полном объёме: у симметричной матрицы существует не просто базис из собственных векторов, а ортонормированный базис, и именно на этом строится корректность канонического вида, который в этом уроке был принят как рабочий факт. Там же появится скалярное произведение — и окажется, что $x^TAx$ для положительно определённой $A$ задаёт новое, «искривлённое» скалярное произведение, чем, по сути, и пользуется расстояние Махаланобиса. Дальше по курсу — сингулярное разложение (SVD), которое обобщает всю эту технику на несимметричные и даже неквадратные матрицы, и курсы по выпуклой оптимизации, где знакоопределённость гессиана — рабочий инструмент на каждом шаге.
Где это нужно в жизни
💻 Программирование. numpy.linalg.eigvalsh для проверки знакоопределённости симметричных матриц, scipy.linalg.cho_factor — разложение Холецкого, которое существует тогда и только тогда, когда матрица положительно определена, и на практике часто служит самой быстрой проверкой определённости. В компьютерной графике квадратичные формы задают эллипсоиды ограничивающих объёмов (bounding volumes).
🤖 ML/AI. Проверка выпуклости функций потерь, критерий сходимости метода Ньютона и квазиньютоновских методов (BFGS), регуляризация Тихонова/ridge, ядерные методы и SVM (положительная определённость ядра — условие Мерсера), гауссовские процессы, диагностика сёдел в ландшафте функции потерь нейросети.
📊 Data Science. Ковариационные и корреляционные матрицы, расстояние Махаланобиса в обнаружении аномалий, PCA как диагонализация ковариационной матрицы, проверка мультиколлинеарности через близость $X^TX$ к вырожденности.
🔬 Наука. Классификация кривых и поверхностей второго порядка (эллипсы, гиперболы, эллипсоиды) по знакам собственных значений; энергия колебательной системы вблизи положения равновесия — квадратичная форма, и её положительная определённость означает устойчивое равновесие; тензор напряжений в механике сплошных сред.
💰 Финансы. Портфельная теория Марковица: риск портфеля — это квадратичная форма от весов активов с матрицей ковариаций доходностей, и задача минимизации риска при заданной доходности — это классическая задача на квадратичные формы с ограничениями.
Интересные факты
-
Слово «инерция» в законе Сильвестра — не случайная метафора. Момент инерции твёрдого тела относительно оси — тоже квадратичная форма, и её значение (в отличие от коэффициентов, зависящих от выбора осей) характеризует физический объект целиком. Сильвестр в 1852 году позаимствовал термин из механики, чтобы подчеркнуть: сигнатура формы — её неотъемлемое, не зависящее от координат свойство, совсем как момент инерции тела не зависит от того, как ты его повернул.
-
Термин «квадратичная форма» пришёл из теории чисел на полтора века раньше матричной алгебры. Гаусс в «Арифметических исследованиях» 1801 года изучал, какие целые числа представимы выражением $ax^2+bxy+cy^2$ с целыми $x,y$ — знаменитая теорема Ферма о том, что простое число представимо в виде суммы двух квадратов тогда и только тогда, когда оно даёт остаток 1 при делении на 4, — прямое следствие этой теории.
-
Разложение Холецкого $A=LL^T$ (с нижнетреугольной $L$) существует для матрицы $A$ тогда и только тогда, когда она положительно определена — и это один из самых быстрых практических тестов на определённость: если при вычислении разложения ни разу не пришлось бы извлекать корень из отрицательного числа, матрица положительно определена. Библиотеки линейной алгебры используют именно этот факт вместо явного вычисления угловых миноров.
-
Условие Мерсера в машинном обучении — это требование положительной полуопределённости ядерной функции, буквальное распространение идеи квадратичной формы с конечномерных векторов на бесконечномерные функциональные пространства. Метод опорных векторов (SVM) и гауссовские процессы работают только с ядрами, удовлетворяющими этому условию, — иначе задача оптимизации теряет гарантию единственного решения.
Лайфхаки и полезные трюки
-
Для матрицы $2\times2$ — короткая проверка через след и определитель. Положительно определена $\iff$ $\det A>0$ и $\operatorname{tr}A>0$. Отрицательно определена $\iff$ $\det A>0$ и $\operatorname{tr}A<0$. Знакопеременная $\iff$ $\det A<0$. Ни определителей подматриц, ни собственных значений считать не нужно — только эти два числа.
-
Для отрицательной определённости не запоминай чередование знаков — проверяй $-A$. Форма отрицательно определена тогда и только тогда, когда $-A$ положительно определена. Считай угловые миноры для $-A$ по обычному правилу «все положительны» — риск перепутать шаблон чередования знаков исчезает полностью.
-
Диагональное преобладание — бесплатная проверка без единого определителя. Если у симметричной матрицы с положительной диагональю каждый диагональный элемент строго больше суммы модулей остальных элементов своей строки, матрица гарантированно положительно определена (задача 28). Для матриц регуляризации и Лапласианов графов это часто выполняется автоматически.
-
Узнавай точный квадрат с первого взгляда. Если дискриминант $2\times2$ подматрицы равен нулю ($\det=0$ при положительной диагонали), форма — это в точности $a(x_1+\tfrac{b}{a}x_2)^2$ (задача 26). Не трать время на вычисление собственных значений — сразу пиши полуопределённость.
-
Гессиан квадратичной функции — постоянная матрица. Если функция уже квадратична (нет слагаемых степени выше второй), гессиан не зависит от точки — посчитать его нужно один раз, а не в каждой точке заново.
-
В коде используй
numpy.linalg.eigvalsh, а неeig, для симметричных матриц. Она быстрее, гарантированно возвращает вещественные числа по возрастанию, и проверка определённости сводится к одной строке:np.all(np.linalg.eigvalsh(A) > 0). Ещё быстрее — попытка разложения Холецкого: еслиnp.linalg.cholesky(A)не выбрасывает исключение, матрица положительно определена. -
Матрицы вида $M^TM$ и $MM^T$ — положительно полуопределены всегда, без вычислений. Это следует из того же рассуждения, что и для ковариационной матрицы: $x^T(M^TM)x=(Mx)^T(Mx)=\|Mx\|^2\ge0$. Узнавай эту структуру в $X^TX$, ковариационных и Грам-матрицах с первого взгляда — доказательство неотрицательности не требует ни определителей, ни собственных значений.
Мы подключили квадратичные формы к собственным значениям, но пока опирались на факт, что у симметричной матрицы собственные векторы можно выбрать ортогональными, — просто приняли это на веру. В следующем уроке про евклидово пространство этот факт получит полное доказательство, а заодно появится язык скалярного произведения, углов и длин, без которого сама фраза «положительно определённая форма задаёт новую геометрию» останется красивой метафорой, а не точным утверждением.
Понял тему? Закрепи в боте! 🚀
Попрактикуйся на задачах и получи персональные рекомендации от AI
💪 Начать тренировку