Files
SecondBrain/01 Library/03 Math/Статистика/Факторный анализ/Постановка задачи снижения размерности признакового пространства.md
T
2026-05-07 17:37:53 +03:00

2.8 KiB

status, type, tags, created, updated, title
status type tags created updated title
seed concept
math
mephi
statistics
factor-analysis
2026-01-18 2026-05-07 Постановка Задачи Снижения Размерности Признакового Пространства

Постановка Задачи Снижения Размерности Признакового Пространства

Задача снижения размерности признакового пространства заключается в определении такого набора признаков Z, найденного в классе допустимых преобразований исходных показателей F(x), чтобы максимизировать или минимизировать критерий информативности:$Im(Z(x))=extr_{Z \in F(x)}\{Im(Z(x))\}$


Исходные система признаков: x = (x_{1},x_{2},\dots,x_{k})^{T} Признаки центрированы: M_{x_{j}}=0,\ \forall j=\overline{1,k} Новая система признаков: z=(z_{1},z_{2},\dots,z_{m})^{T},\ m << k Критерий информативности: Im(Z(x)) = extr_{z \in F(x)}\{Im(Z(x))\}

Im(Z(x)) = \frac{D_{z_{1}}+\dots+D_{z_{m}}}{D_{x_{1}}+\dots+D_{x_{k}}} - отношение суммарной дисперсии новой системы признаков к суммарной дисперсии исходной системы.

[!warning] Критерий Необходимо отобрать столько признаков, чтобы суммарная вариация (дисперсия) исходных признаков в больше степени объяснялась дисперсией вновь введенных признаков.

Замечание:

  1. В случае нормирования признаков, \text{ковариационная матрица признаков}\ x^{*}==\text{корелляционной матрице исх.признаков} \Sigma_{x^{*}}=R_{x}
  2. Если признаки имеют разный масштаб, то необходимо провести их нормирование, т.е. перейти X_{j}^{*}=\frac{X_{j}}{\sqrt{DX_{j}}},\ DX_{j}^{*}=1,\ \forall j = \overline{1,k}

Связанные заметки

  • Линейные модели — снижение размерности (PCA) используется как предобработка перед линейными моделями в ML; матрица X в обоих случаях одинакова
  • Метрические алгоритмы — kNN страдает от проклятия размерности; снижение размерности напрямую улучшает качество kNN