2.8 KiB
status, type, tags, created, updated, title
| status | type | tags | created | updated | title | ||||
|---|---|---|---|---|---|---|---|---|---|
| seed | concept |
|
2026-01-18 | 2026-05-07 | Постановка Задачи Снижения Размерности Признакового Пространства |
Постановка Задачи Снижения Размерности Признакового Пространства
Задача снижения размерности признакового пространства заключается в определении такого набора признаков Z, найденного в классе допустимых преобразований исходных показателей F(x), чтобы максимизировать или минимизировать критерий информативности:$Im(Z(x))=extr_{Z \in F(x)}\{Im(Z(x))\}$
Исходные система признаков: x = (x_{1},x_{2},\dots,x_{k})^{T}
Признаки центрированы: M_{x_{j}}=0,\ \forall j=\overline{1,k}
Новая система признаков: z=(z_{1},z_{2},\dots,z_{m})^{T},\ m << k
Критерий информативности: Im(Z(x)) = extr_{z \in F(x)}\{Im(Z(x))\}
Im(Z(x)) = \frac{D_{z_{1}}+\dots+D_{z_{m}}}{D_{x_{1}}+\dots+D_{x_{k}}} - отношение суммарной дисперсии новой системы признаков к суммарной дисперсии исходной системы.
[!warning] Критерий Необходимо отобрать столько признаков, чтобы суммарная вариация (дисперсия) исходных признаков в больше степени объяснялась дисперсией вновь введенных признаков.
Замечание:
- В случае нормирования признаков,
\text{ковариационная матрица признаков}\ x^{*}==\text{корелляционной матрице исх.признаков}\Sigma_{x^{*}}=R_{x} - Если признаки имеют разный масштаб, то необходимо провести их нормирование, т.е. перейти
X_{j}^{*}=\frac{X_{j}}{\sqrt{DX_{j}}},\ DX_{j}^{*}=1,\ \forall j = \overline{1,k}
Связанные заметки
- Линейные модели — снижение размерности (PCA) используется как предобработка перед линейными моделями в ML; матрица X в обоих случаях одинакова
- Метрические алгоритмы — kNN страдает от проклятия размерности; снижение размерности напрямую улучшает качество kNN