Квадратичные формы и метрика Махаланобиса: геометрия вероятностей
В классическом евклидовом пространстве расстояние между точками измеряется с помощью теоремы Пифагора, что математически эквивалентно использованию единичной матрицы в квадратичной форме. Однако в статистике и машинном обучении данные часто имеют сложную структуру: переменные имеют разный масштаб (например, рост в метрах и вес в граммах) и сильно коррелируют друг с другом (высокие люди обычно весят больше). Использование обычного евклидова расстояния для поиска аномалий или кластеризации таких данных приведет к катастрофическим ошибкам. Индийский статистик Прасанта Чандра Махаланобис решил эту проблему, внедрив в формулу расстояния обратную ковариационную матрицу. Метрика Махаланобиса превращает облако зависимых вероятностей в идеально круглое, симметричное пространство.
Ограничения евклидовой метрики
Квадрат евклидова расстояния от точки (вектора x) до центра масс (вектора mu) вычисляется как скалярное произведение вектора разности на самого себя: (x - mu)^T * (x - mu). Если нарисовать линии равного расстояния (изолинии) от центра, мы получим идеальные сферы (или круги на плоскости). Но реальные многомерные данные из-за дисперсии и ковариации обычно образуют вытянутые наклонные эллипсоиды. Точка, находящаяся на кончике этого вытянутого эллипсоида (вдоль направления главного распределения данных), является вполне нормальным, типичным объектом. Однако евклидово расстояние покажет, что она находится невероятно далеко от центра, и алгоритм ошибочно классифицирует ее как аномалию (выброс), проигнорировав внутреннюю геометрию данных.
Обратная ковариационная матрица и декорреляция
Расстояние Махаланобиса устраняет этот недостаток с помощью алгебры квадратичных форм. В центр формулы помещается матрица S^(-1) (обратная матрица ковариации обучающей выборки). Формула приобретает вид: D^2 = (x - mu)^T * S^(-1) * (x - mu). Матрица ковариации S является симметричной и положительно определенной, следовательно, ее обратная матрица S^(-1) обладает теми же свойствами, что делает эту формулу математически корректной метрикой (квадрат расстояния всегда больше нуля). Умножение на эту матрицу осуществляет два важнейших геометрических преобразования: оно масштабирует оси (приводя все переменные к единичной дисперсии) и осуществляет вращение системы координат (полностью устраняя взаимные корреляции между признаками).
Связь с сингулярным разложением и отбеливанием данных
Глубокий алгебраический смысл метрики Махаланобиса раскрывается через разложение Холецкого или спектральное разложение. Поскольку обратная ковариационная матрица положительно определена, мы можем разложить ее как S^(-1) = W^T * W. Подставив это в исходную формулу, мы получим D^2 = (W*(x - mu))^T * (W*(x - mu)). Это не что иное, как обычное евклидово расстояние, но вычисленное для новых, преобразованных векторов z = W*(x - mu). Преобразование W называется «отбеливанием» (Whitening transformation) или трансформацией Махаланобиса. Оно проецирует любые искаженные, вытянутые данные в новое векторное пространство, где облако точек превращается в идеальный, равномерный шар, лишенный каких-либо статистических зависимостей по осям.
Применение в алгоритмах классификации и поиске аномалий
В мире Data Science расстояние Махаланобиса является абсолютным стандартом для выявления выбросов (Outlier Detection) в многомерных данных (например, при мониторинге мошеннических транзакций в банках). Вычисленный квадрат расстояния D^2 для нормальных объектов статистически подчиняется распределению Хи-квадрат с количеством степеней свободы, равным размерности векторов. Это позволяет задавать строгие доверительные интервалы (например, 99%), отсекая аномалии алгебраическим фильтром. В задачах Metric Learning алгоритмы нейросетей специально обучаются находить такую симметричную матрицу M, подстановка которой в квадратичную форму (x-y)^T * M * (x-y) обеспечивала бы минимальное расстояние между объектами одного класса и максимальное — между объектами разных классов.
Related items
- Матрицы Тёплица и циркулянты: структура и быстрое преобразование
- Теорема Шура-Хорна и мажоризация: ограничения на диагонали матриц
- Линейная алгебра в теории графов: матрица смежности и лапласиан
- Перманент матрицы: алгебраический двойник определителя и проблема #P-полноты
- Псевдообратная матрица Мура-Пенроуза: теория и практика