3.9 KiB
3.9 KiB
status, type, tags, created, updated, title
| status | type | tags | created | updated | title | ||
|---|---|---|---|---|---|---|---|
| seed | concept |
|
2026-01-05 | 2026-02-27 | Итерационные Методы |
Итерационные Методы
Процедуры классификации, которые, в отличие от иерархических методов, не строят дерево (дендрограмму), а разбивают совокупность объектов на кластеры путем последовательного улучшения начального разбиения.
К-средних
Метод K-средних относится к методам итерационной классификации. В результате строится ровно k различных, наиболее удаленных друг от друга, кластеров.
[!important] Цель метода Минимизировать изменчивость внутри кластеров и максимизировать изменчивость между кластерами.
Объекты перемещаются из одних кластеров в другие для того, чтобы получить наиболее значимый результат: максимальное отношение межгрупповой дисперсии к внутригрупповой.
Алгоритм
- Задаются
kслучайно выбранных объектов (число классов) - эталоны\epsilon - Из оставшихся
N-kобъектов извлекается объект и проверяется, к какому их эталонов он ближе (по мерам расстояния). Данных объект присоединяется к тому эталону, для которого наблюдается минимальное расстояние\min_{1 \leq l \leq k} \rho_{il}Веса и эталоны пересчитываются по принципу: $$\begin{align} \epsilon_{i} = \begin{cases} \frac{\omega_{i}*\epsilon_{i}+O}{\omega_{i}+1},\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \ \epsilon_{i},\ \text{в других случаях} \end{cases} \ \omega_{i} = \begin{cases} \omega_{i}+1,\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \ \omega_{i},\ \text{в других случаях} \end{cases} \end{align}$$\omega_{i}- весi-гокласса. Изначально считается, что\epsilon_{i}=O_{i},\ \omega_{i}=1,\ i=\overline{1,k} - После рассмотрения каждого из
N-kобъектов, все объекты будут распределены наkклассов - на этом первая итерация алгоритма закончена. - Для достижения устойчивого разбиения, итерация повторяется, а веса продолжают накапливаться. Новое разбиение сравнивается с предыдущим. Если совпадают, то работа алгоритма завершается, в противном случае - алгоритм повторяется.
Недостатками метода можно отметить:
- неясно, как выбирать исходные центры кластеров.
- число кластеров надо знать заранее.
Связанные заметки
- Метрические алгоритмы — kNN также классифицирует по минимальному расстоянию до ближайших объектов; supervised-аналог K-means
- Расстояние между объектами — метрики расстояния, используемые при вычислении
\min \rho_{il}