51 lines
3.9 KiB
Markdown
51 lines
3.9 KiB
Markdown
---
|
||
status: seed
|
||
type: concept
|
||
tags:
|
||
- mephi
|
||
- math
|
||
- statistics
|
||
- cluster-analysis
|
||
created: 2026-01-05
|
||
updated: 2026-05-07
|
||
title: Итерационные Методы
|
||
---
|
||
|
||
# Итерационные Методы
|
||
Процедуры классификации, которые, в отличие от иерархических методов, не строят дерево (дендрограмму), а разбивают совокупность объектов на кластеры путем последовательного улучшения начального разбиения.
|
||
|
||
# К-средних
|
||
Метод K-средних относится к методам итерационной классификации. В результате строится ровно $k$ различных, наиболее удаленных друг от друга, кластеров.
|
||
|
||
> [!important] Цель метода
|
||
> **Минимизировать** изменчивость внутри кластеров и **максимизировать** изменчивость между кластерами.
|
||
|
||
Объекты перемещаются из одних кластеров в другие для того, чтобы получить наиболее значимый результат: **максимальное отношение межгрупповой дисперсии к внутригрупповой.**
|
||
|
||
## Алгоритм
|
||
1) Задаются $k$ случайно выбранных объектов (число классов) - эталоны $\epsilon$
|
||
2) Из оставшихся $N-k$ объектов извлекается объект и проверяется, к какому их эталонов он ближе (по мерам расстояния). Данных объект присоединяется к тому эталону, для которого наблюдается минимальное расстояние $\min_{1 \leq l \leq k} \rho_{il}$
|
||
Веса и эталоны пересчитываются по принципу:
|
||
$$\begin{align}
|
||
\epsilon_{i} = \begin{cases}
|
||
\frac{\omega_{i}*\epsilon_{i}+O}{\omega_{i}+1},\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\
|
||
\epsilon_{i},\ \text{в других случаях}
|
||
\end{cases}
|
||
\\
|
||
\omega_{i} = \begin{cases}
|
||
\omega_{i}+1,\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\
|
||
\omega_{i},\ \text{в других случаях}
|
||
\end{cases}
|
||
\end{align}$$
|
||
$\omega_{i}$ - вес $i-го$ класса. Изначально считается, что $\epsilon_{i}=O_{i},\ \omega_{i}=1,\ i=\overline{1,k}$
|
||
3) После рассмотрения каждого из $N-k$ объектов, все объекты будут распределены на $k$ классов - на этом первая итерация алгоритма закончена.
|
||
4) Для достижения устойчивого разбиения, итерация повторяется, а веса продолжают накапливаться. Новое разбиение сравнивается с предыдущим. Если совпадают, то работа алгоритма завершается, в противном случае - алгоритм повторяется.
|
||
|
||
Недостатками метода можно отметить:
|
||
- неясно, как выбирать исходные центры кластеров.
|
||
- число кластеров надо знать заранее.
|
||
|
||
## Связанные заметки
|
||
- [[Метрические алгоритмы]] — kNN также классифицирует по минимальному расстоянию до ближайших объектов; supervised-аналог K-means
|
||
- [[Расстояние между объектами]] — метрики расстояния, используемые при вычислении $\min \rho_{il}$
|