Files
SecondBrain/90 Library/Math/Статистика/Кластерный анализ/Итерационная классификация. Метод K-средних (K-means).md
T
2026-05-24 15:03:28 +03:00

51 lines
3.9 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
---
status: seed
type: concept
tags:
- mephi
- math
- statistics
- cluster-analysis
created: 2026-01-05
updated: 2026-05-07
title: Итерационные Методы
---
# Итерационные Методы
Процедуры классификации, которые, в отличие от иерархических методов, не строят дерево (дендрограмму), а разбивают совокупность объектов на кластеры путем последовательного улучшения начального разбиения.
# К-средних
Метод K-средних относится к методам итерационной классификации. В результате строится ровно $k$ различных, наиболее удаленных друг от друга, кластеров.
> [!important] Цель метода
> **Минимизировать** изменчивость внутри кластеров и **максимизировать** изменчивость между кластерами.
Объекты перемещаются из одних кластеров в другие для того, чтобы получить наиболее значимый результат: **максимальное отношение межгрупповой дисперсии к внутригрупповой.**
## Алгоритм
1) Задаются $k$ случайно выбранных объектов (число классов) - эталоны $\epsilon$
2) Из оставшихся $N-k$ объектов извлекается объект и проверяется, к какому их эталонов он ближе (по мерам расстояния). Данных объект присоединяется к тому эталону, для которого наблюдается минимальное расстояние $\min_{1 \leq l \leq k} \rho_{il}$
Веса и эталоны пересчитываются по принципу:
$$\begin{align}
\epsilon_{i} = \begin{cases}
\frac{\omega_{i}*\epsilon_{i}+O}{\omega_{i}+1},\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\
\epsilon_{i},\ \text{в других случаях}
\end{cases}
\\
\omega_{i} = \begin{cases}
\omega_{i}+1,\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\
\omega_{i},\ \text{в других случаях}
\end{cases}
\end{align}$$
$\omega_{i}$ - вес $i-го$ класса. Изначально считается, что $\epsilon_{i}=O_{i},\ \omega_{i}=1,\ i=\overline{1,k}$
3) После рассмотрения каждого из $N-k$ объектов, все объекты будут распределены на $k$ классов - на этом первая итерация алгоритма закончена.
4) Для достижения устойчивого разбиения, итерация повторяется, а веса продолжают накапливаться. Новое разбиение сравнивается с предыдущим. Если совпадают, то работа алгоритма завершается, в противном случае - алгоритм повторяется.
Недостатками метода можно отметить:
- неясно, как выбирать исходные центры кластеров.
- число кластеров надо знать заранее.
## Связанные заметки
- [[Метрические алгоритмы]] — kNN также классифицирует по минимальному расстоянию до ближайших объектов; supervised-аналог K-means
- [[Расстояние между объектами]] — метрики расстояния, используемые при вычислении $\min \rho_{il}$