--- status: seed type: concept tags: - mephi - math - statistics - cluster-analysis created: 2026-01-05 updated: 2026-05-07 title: Итерационные Методы --- # Итерационные Методы Процедуры классификации, которые, в отличие от иерархических методов, не строят дерево (дендрограмму), а разбивают совокупность объектов на кластеры путем последовательного улучшения начального разбиения. # К-средних Метод K-средних относится к методам итерационной классификации. В результате строится ровно $k$ различных, наиболее удаленных друг от друга, кластеров. > [!important] Цель метода > **Минимизировать** изменчивость внутри кластеров и **максимизировать** изменчивость между кластерами. Объекты перемещаются из одних кластеров в другие для того, чтобы получить наиболее значимый результат: **максимальное отношение межгрупповой дисперсии к внутригрупповой.** ## Алгоритм 1) Задаются $k$ случайно выбранных объектов (число классов) - эталоны $\epsilon$ 2) Из оставшихся $N-k$ объектов извлекается объект и проверяется, к какому их эталонов он ближе (по мерам расстояния). Данных объект присоединяется к тому эталону, для которого наблюдается минимальное расстояние $\min_{1 \leq l \leq k} \rho_{il}$ Веса и эталоны пересчитываются по принципу: $$\begin{align} \epsilon_{i} = \begin{cases} \frac{\omega_{i}*\epsilon_{i}+O}{\omega_{i}+1},\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\ \epsilon_{i},\ \text{в других случаях} \end{cases} \\ \omega_{i} = \begin{cases} \omega_{i}+1,\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\ \omega_{i},\ \text{в других случаях} \end{cases} \end{align}$$ $\omega_{i}$ - вес $i-го$ класса. Изначально считается, что $\epsilon_{i}=O_{i},\ \omega_{i}=1,\ i=\overline{1,k}$ 3) После рассмотрения каждого из $N-k$ объектов, все объекты будут распределены на $k$ классов - на этом первая итерация алгоритма закончена. 4) Для достижения устойчивого разбиения, итерация повторяется, а веса продолжают накапливаться. Новое разбиение сравнивается с предыдущим. Если совпадают, то работа алгоритма завершается, в противном случае - алгоритм повторяется. Недостатками метода можно отметить: - неясно, как выбирать исходные центры кластеров. - число кластеров надо знать заранее. ## Связанные заметки - [[Метрические алгоритмы]] — kNN также классифицирует по минимальному расстоянию до ближайших объектов; supervised-аналог K-means - [[Расстояние между объектами]] — метрики расстояния, используемые при вычислении $\min \rho_{il}$