Files
SecondBrain/01 Library/03 Math/Статистика/Кластерный анализ/Итерационная классификация. Метод K-средних (K-means).md
T
2026-05-07 17:37:53 +03:00

3.9 KiB
Raw Blame History

status, type, tags, created, updated, title
status type tags created updated title
seed concept
mephi
math
statistics
cluster-analysis
2026-01-05 2026-05-07 Итерационные Методы

Итерационные Методы

Процедуры классификации, которые, в отличие от иерархических методов, не строят дерево (дендрограмму), а разбивают совокупность объектов на кластеры путем последовательного улучшения начального разбиения.

К-средних

Метод K-средних относится к методам итерационной классификации. В результате строится ровно k различных, наиболее удаленных друг от друга, кластеров.

[!important] Цель метода Минимизировать изменчивость внутри кластеров и максимизировать изменчивость между кластерами.

Объекты перемещаются из одних кластеров в другие для того, чтобы получить наиболее значимый результат: максимальное отношение межгрупповой дисперсии к внутригрупповой.

Алгоритм

  1. Задаются k случайно выбранных объектов (число классов) - эталоны \epsilon
  2. Из оставшихся N-k объектов извлекается объект и проверяется, к какому их эталонов он ближе (по мерам расстояния). Данных объект присоединяется к тому эталону, для которого наблюдается минимальное расстояние \min_{1 \leq l \leq k} \rho_{il} Веса и эталоны пересчитываются по принципу: $$\begin{align} \epsilon_{i} = \begin{cases} \frac{\omega_{i}*\epsilon_{i}+O}{\omega_{i}+1},\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \ \epsilon_{i},\ \text{в других случаях} \end{cases} \ \omega_{i} = \begin{cases} \omega_{i}+1,\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \ \omega_{i},\ \text{в других случаях} \end{cases} \end{align}$$ \omega_{i} - вес i-го класса. Изначально считается, что \epsilon_{i}=O_{i},\ \omega_{i}=1,\ i=\overline{1,k}
  3. После рассмотрения каждого из N-k объектов, все объекты будут распределены на k классов - на этом первая итерация алгоритма закончена.
  4. Для достижения устойчивого разбиения, итерация повторяется, а веса продолжают накапливаться. Новое разбиение сравнивается с предыдущим. Если совпадают, то работа алгоритма завершается, в противном случае - алгоритм повторяется.

Недостатками метода можно отметить:

  • неясно, как выбирать исходные центры кластеров.
  • число кластеров надо знать заранее.

Связанные заметки

  • Метрические алгоритмы — kNN также классифицирует по минимальному расстоянию до ближайших объектов; supervised-аналог K-means
  • Расстояние между объектами — метрики расстояния, используемые при вычислении \min \rho_{il}