vault backup: 2026-05-14 10:49:10
This commit is contained in:
+52
@@ -0,0 +1,52 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- math
|
||||
- mephi
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-18
|
||||
updated: 2026-05-07
|
||||
title: Агломеративные (иерархические) Методы
|
||||
---
|
||||
|
||||
# Агломеративные (иерархические) Методы
|
||||
|
||||
Принцип работы агломеративных методов кластеризации заключается в последовательном объединении групп наиболее приближенных объектов, а потом всё более далеких друг от друга.
|
||||
|
||||
На первом шаге, каждый объект - отдельный класс.
|
||||
На каждом последующем, мы объединяем самые близкие классы в один.
|
||||
Алгоритм заканчивается, когда остается всего один класс.
|
||||
|
||||
Если ставится задача разбиения на несколько кластеров, то устанавливается пороговое значение расстояния $\rho$, превышение которого прекращает цикл.
|
||||
|
||||
## Алгоритм
|
||||
1) Центрирование и нормирование значений исходных признаков
|
||||
2) Расчет матрицы расстояний между объектами (каждый объект - отдельный класс)
|
||||
3) Объединение двух ближайших классов
|
||||
4) Пересчет матрицы расстояний между классами ([[Расстояние между классами объектов|по выбранному методу]])
|
||||
5) Повторение процедуры до достижения необходимого количества классов
|
||||
|
||||
## Методы Связывания Классов
|
||||
1) <u>Одиночная связь</u> (метод ближайшего соседа)
|
||||
Расстояние между кластерами определяется, как расстояние между двумя наиболее близкими объектами в этих кластерах. Такие кластеры имеют тенденцию представляться в виде *"цепочек"*.
|
||||
2) <u>Полная связь</u> (метод дальнего соседа)
|
||||
Наибольшее расстояние между двумя объектами из разных кластеров. (Но из этих "максимальных расстояний" выбираем минимальное)
|
||||
3) <u>Невзвешенное попарное среднее</u>
|
||||
Расстояние вычисляется как **среднее расстояние между всеми парами** объектов в двух классах.
|
||||
4) <u>Взвешенное попарное среднее</u>
|
||||
Аналогично невзвешенному, но предполагаются неравные размеры кластеров, поэтому размер кластера (т.е. число объектов в нем) используется в качестве весового коэффициента.
|
||||
5) <u>Невзвешенный центроидный метод</u>
|
||||
Расстояние м/у двумя кластерами определяется как расстояние между их центрами тяжести.
|
||||
6) <u>Взвешенный центроидный метод</u>
|
||||
Аналогично невзвешенному, но при вычислениях используются веса для учета разницы между кластерами.
|
||||
7) **<u>Метод Уорда</u>**
|
||||
Использует методы дисперсионного анализа для оценки расстояний между кластерами. Метод минимизирует сумму квадратов $(SS)$ для любых двух кластеров, которые могут быть сформированы на каждом шаге.
|
||||
*Метод эффективен, но стремиться к кластерам малого размера.*
|
||||
|
||||
## Связанные заметки
|
||||
- [[Постановка задачи Кластерного анализа]] — формальная постановка задачи разбиения
|
||||
- [[Расстояние между классами объектов]] — метрики, используемые в шаге объединения классов
|
||||
- [[Дивизимные методы]] — противоположный подход: от одного класса к N
|
||||
- [[Критерии определения оптимального числа классов]] — как выбрать порог остановки алгоритма
|
||||
Reference in New Issue
Block a user