vault backup: 2026-05-24 15:03:28
This commit is contained in:
+52
@@ -0,0 +1,52 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- math
|
||||
- mephi
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-18
|
||||
updated: 2026-05-07
|
||||
title: Агломеративные (иерархические) Методы
|
||||
---
|
||||
|
||||
# Агломеративные (иерархические) Методы
|
||||
|
||||
Принцип работы агломеративных методов кластеризации заключается в последовательном объединении групп наиболее приближенных объектов, а потом всё более далеких друг от друга.
|
||||
|
||||
На первом шаге, каждый объект - отдельный класс.
|
||||
На каждом последующем, мы объединяем самые близкие классы в один.
|
||||
Алгоритм заканчивается, когда остается всего один класс.
|
||||
|
||||
Если ставится задача разбиения на несколько кластеров, то устанавливается пороговое значение расстояния $\rho$, превышение которого прекращает цикл.
|
||||
|
||||
## Алгоритм
|
||||
1) Центрирование и нормирование значений исходных признаков
|
||||
2) Расчет матрицы расстояний между объектами (каждый объект - отдельный класс)
|
||||
3) Объединение двух ближайших классов
|
||||
4) Пересчет матрицы расстояний между классами ([[Расстояние между классами объектов|по выбранному методу]])
|
||||
5) Повторение процедуры до достижения необходимого количества классов
|
||||
|
||||
## Методы Связывания Классов
|
||||
1) <u>Одиночная связь</u> (метод ближайшего соседа)
|
||||
Расстояние между кластерами определяется, как расстояние между двумя наиболее близкими объектами в этих кластерах. Такие кластеры имеют тенденцию представляться в виде *"цепочек"*.
|
||||
2) <u>Полная связь</u> (метод дальнего соседа)
|
||||
Наибольшее расстояние между двумя объектами из разных кластеров. (Но из этих "максимальных расстояний" выбираем минимальное)
|
||||
3) <u>Невзвешенное попарное среднее</u>
|
||||
Расстояние вычисляется как **среднее расстояние между всеми парами** объектов в двух классах.
|
||||
4) <u>Взвешенное попарное среднее</u>
|
||||
Аналогично невзвешенному, но предполагаются неравные размеры кластеров, поэтому размер кластера (т.е. число объектов в нем) используется в качестве весового коэффициента.
|
||||
5) <u>Невзвешенный центроидный метод</u>
|
||||
Расстояние м/у двумя кластерами определяется как расстояние между их центрами тяжести.
|
||||
6) <u>Взвешенный центроидный метод</u>
|
||||
Аналогично невзвешенному, но при вычислениях используются веса для учета разницы между кластерами.
|
||||
7) **<u>Метод Уорда</u>**
|
||||
Использует методы дисперсионного анализа для оценки расстояний между кластерами. Метод минимизирует сумму квадратов $(SS)$ для любых двух кластеров, которые могут быть сформированы на каждом шаге.
|
||||
*Метод эффективен, но стремиться к кластерам малого размера.*
|
||||
|
||||
## Связанные заметки
|
||||
- [[Постановка задачи Кластерного анализа]] — формальная постановка задачи разбиения
|
||||
- [[Расстояние между классами объектов]] — метрики, используемые в шаге объединения классов
|
||||
- [[Дивизимные методы]] — противоположный подход: от одного класса к N
|
||||
- [[Критерии определения оптимального числа классов]] — как выбрать порог остановки алгоритма
|
||||
+28
@@ -0,0 +1,28 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-18
|
||||
updated: 2026-05-07
|
||||
title: Дивизимные Методы
|
||||
---
|
||||
|
||||
# Дивизимные Методы
|
||||
|
||||
> Принцип работы обратен [[Агломеративные (иерархические) методы|Агломерации]].
|
||||
|
||||
Первоначально все объекты в одном кластере, выбираются два **наиболее** удаленных объекта, и их берут за основу двух новых кластеров.
|
||||
Далее, остальные объекты распределяют по этим классам по принципу наименьшего расстояния до его центра.
|
||||
Далее уже эти два класса делят на 4 по тому же принципу.
|
||||
<u>Цикл происходит до тех пор, пока каждый объект не станет отдельный классом.</u>
|
||||
|
||||
Преимущество дивизимных методов заключается в том, что все расчеты осуществляются на основе исходной **матрицы расстояний**, не нуждающейся в постоянном пересчете.
|
||||
|
||||
## Связанные заметки
|
||||
- [[Постановка задачи Кластерного анализа]] — формальная постановка задачи разбиения
|
||||
- [[Агломеративные (иерархические) методы]] — противоположный подход: от N классов к одному
|
||||
- [[Расстояние между классами объектов]] — матрица расстояний, на которой работает алгоритм
|
||||
|
||||
+22
@@ -0,0 +1,22 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- math
|
||||
- mephi
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-18
|
||||
updated: 2026-05-07
|
||||
title: Интерпретация Результатов Кластеризации
|
||||
---
|
||||
|
||||
# Интерпретация Результатов Кластеризации
|
||||
1) <u>Анализ средних значений</u>
|
||||
- *Расчет* *средних*:
|
||||
Для каждого выделенного кластера вычисляются средние значения всех признаков, участвовавших в классификации.
|
||||
- *Визуализация*:
|
||||
Строятся графики средних значений (профили кластеров). Благодаря своей наглядности, они позволяют охарактеризовать каждый класс и провести сравнительный анализ между группами.
|
||||
- *Присвоение имен*:
|
||||
Конечной целью этого этапа является присвоение каждому кластеру понятного названия, отражающего его специфику (например, "клиенты с высоким доходом", "рискованные заемщики" и т.д.).
|
||||
|
||||
+50
@@ -0,0 +1,50 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- mephi
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-05
|
||||
updated: 2026-05-07
|
||||
title: Итерационные Методы
|
||||
---
|
||||
|
||||
# Итерационные Методы
|
||||
Процедуры классификации, которые, в отличие от иерархических методов, не строят дерево (дендрограмму), а разбивают совокупность объектов на кластеры путем последовательного улучшения начального разбиения.
|
||||
|
||||
# К-средних
|
||||
Метод K-средних относится к методам итерационной классификации. В результате строится ровно $k$ различных, наиболее удаленных друг от друга, кластеров.
|
||||
|
||||
> [!important] Цель метода
|
||||
> **Минимизировать** изменчивость внутри кластеров и **максимизировать** изменчивость между кластерами.
|
||||
|
||||
Объекты перемещаются из одних кластеров в другие для того, чтобы получить наиболее значимый результат: **максимальное отношение межгрупповой дисперсии к внутригрупповой.**
|
||||
|
||||
## Алгоритм
|
||||
1) Задаются $k$ случайно выбранных объектов (число классов) - эталоны $\epsilon$
|
||||
2) Из оставшихся $N-k$ объектов извлекается объект и проверяется, к какому их эталонов он ближе (по мерам расстояния). Данных объект присоединяется к тому эталону, для которого наблюдается минимальное расстояние $\min_{1 \leq l \leq k} \rho_{il}$
|
||||
Веса и эталоны пересчитываются по принципу:
|
||||
$$\begin{align}
|
||||
\epsilon_{i} = \begin{cases}
|
||||
\frac{\omega_{i}*\epsilon_{i}+O}{\omega_{i}+1},\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\
|
||||
\epsilon_{i},\ \text{в других случаях}
|
||||
\end{cases}
|
||||
\\
|
||||
\omega_{i} = \begin{cases}
|
||||
\omega_{i}+1,\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\
|
||||
\omega_{i},\ \text{в других случаях}
|
||||
\end{cases}
|
||||
\end{align}$$
|
||||
$\omega_{i}$ - вес $i-го$ класса. Изначально считается, что $\epsilon_{i}=O_{i},\ \omega_{i}=1,\ i=\overline{1,k}$
|
||||
3) После рассмотрения каждого из $N-k$ объектов, все объекты будут распределены на $k$ классов - на этом первая итерация алгоритма закончена.
|
||||
4) Для достижения устойчивого разбиения, итерация повторяется, а веса продолжают накапливаться. Новое разбиение сравнивается с предыдущим. Если совпадают, то работа алгоритма завершается, в противном случае - алгоритм повторяется.
|
||||
|
||||
Недостатками метода можно отметить:
|
||||
- неясно, как выбирать исходные центры кластеров.
|
||||
- число кластеров надо знать заранее.
|
||||
|
||||
## Связанные заметки
|
||||
- [[Метрические алгоритмы]] — kNN также классифицирует по минимальному расстоянию до ближайших объектов; supervised-аналог K-means
|
||||
- [[Расстояние между объектами]] — метрики расстояния, используемые при вычислении $\min \rho_{il}$
|
||||
+47
@@ -0,0 +1,47 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- mephi
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2025-12-25
|
||||
updated: 2026-05-07
|
||||
title: Классификация
|
||||
---
|
||||
|
||||
# Классификация
|
||||
|
||||
> [!note] Определение
|
||||
> Классификация - это:
|
||||
> 1) разделение рассматриваемой совокупности объектов/явлений на **однородные группы**
|
||||
> 2) отнесение каждого из заданного множества объектов к одному из заранее известных классов
|
||||
|
||||
## Исходные Статистические Данные В Задачах Классификации
|
||||
1) Матрица "**объект-свойство**" или матрица парных сравнений:$$X_{N*k}=
|
||||
\begin{pmatrix}
|
||||
x_{11} & \dots & x_{1k} \\
|
||||
\vdots & \ddots & \vdots \\
|
||||
x_{N1} & \dots & x_{Nk}
|
||||
\end{pmatrix}\ \text{или} \ \ \gamma_{N*N}= \begin{pmatrix}
|
||||
\gamma_{11} & \dots & \gamma_{1N} \\
|
||||
\vdots & \ddots & \vdots \\
|
||||
\gamma_{N1} & \dots & \gamma_{NN}
|
||||
\end{pmatrix}$$
|
||||
2) Обучающие выборки $X^{(1)}, X^{(2)}, \dots, X^{(p)}$ -> набор объектов, для которых заранее известно к каким классам они относятся:$$X_{n_{j}*k}^{(j)}=
|
||||
\begin{pmatrix} x_{11}^{(j)} & \dots & x_{1k}^{(j)} \\ \vdots & \ddots & \vdots \\ x_{n_{j}1}^{(j)} & \dots & x_{n_{j}k}^{(j)}
|
||||
\end{pmatrix},\ \text{где}\ j=\overline{1,p}$$
|
||||
|
||||
## Типологизация Задач Классификации
|
||||
|
||||
| Априорные сведения о классах | Без обучающих выборок | С обучающими выборками |
|
||||
| --------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------- | -------------------------------------------------------------------------------------------------------- |
|
||||
| Не известен вид закона распределения в классах | Классификация без обучения (непараметрический случай): <u>**кластерный анализ**</u> | Классификация с обучением (непараметрический случай): **<u>дискриминантный анализ</u>** |
|
||||
| Известен вид закона распределения в классах (***параметра распределения не известны***) | Классификация без обучения (параметрический случай) <u>**расщепление смесей вероятностных распределений**</u> | Классификация с обучением (параметрический случай) <u>**параметрический дискриминантный анализ**</u><br> |
|
||||
| Полностью известен закон распределения в классах | Проверка статических гипотез | Обучающие выборки не нужны |
|
||||
|
||||
## Связанные заметки
|
||||
- [[Кластерный анализ]] — детальное рассмотрение классификации без обучения
|
||||
- [[Дискриминантный анализ]] — детальное рассмотрение классификации с обучением
|
||||
- [[Постановка задачи Кластерного анализа]] — формальная постановка задачи
|
||||
+34
@@ -0,0 +1,34 @@
|
||||
---
|
||||
status: stable
|
||||
type: moc
|
||||
tags:
|
||||
- math
|
||||
- mephi
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-05-02
|
||||
updated: 2026-05-07
|
||||
title: Кластерный Анализ
|
||||
---
|
||||
|
||||
# Кластерный Анализ
|
||||
|
||||
%% Begin Waypoint %%
|
||||
- [[Агломеративные (иерархические) методы]]
|
||||
- [[Дивизимные методы]]
|
||||
- [[Интерпретация результатов кластеризации]]
|
||||
- [[Итерационная классификация. Метод K-средних (K-means)]]
|
||||
- [[Классификация]]
|
||||
- [[Критерии определения оптимального числа классов]]
|
||||
- [[Наивный Байесовский алгоритм]]
|
||||
- [[Понятие однородности объектов]]
|
||||
- [[Постановка задачи Кластерного анализа]]
|
||||
- [[Расстояние между классами объектов]]
|
||||
- [[Расстояние между объектами]]
|
||||
- [[Функционалы качества разбиения]]
|
||||
|
||||
%% End Waypoint %%
|
||||
|
||||
## Контекст
|
||||
- [[Классификация]] — типология задач классификации: кластерный vs. дискриминантный анализ
|
||||
- [[Дискриминантный анализ]] — классификация с обучающей выборкой (в отличие от кластерного)
|
||||
+21
@@ -0,0 +1,21 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-18
|
||||
updated: 2026-05-07
|
||||
title: Критерии Определения Оптимального Числа Классов
|
||||
---
|
||||
|
||||
# Критерии Определения Оптимального Числа Классов
|
||||
1) <u>Визуальный анализ дендрограммы</u>:
|
||||
Большой разрыв между уровнями разбиения $\rho_{0}$ и $\rho_{1}>\rho_{0}$ говорит о том, что оптимальное количество классов равно $\rho_{0}$
|
||||
2) <u>Формальные статистические критерии</u>:
|
||||
- *Индекс Калински и Харабаза* (сравнение разброса внутри кластеров с разбросом между кластерами)
|
||||
$G = \frac{trace(B)/(p-1)}{trace(W)/(n-p)}$, где $B$ - матрица межгруппового рассеяния, $W$ - матрица внутригруппового рассеяния, $p$ - кол-во классов, $n$ - объем выборки.
|
||||
Оптимальным считается разбиение, когда индекс принимает **максимальное значение**.
|
||||
- *Индекс Дуды и Харта*
|
||||
1) [[Функционалы качества разбиения]]
|
||||
+20
@@ -0,0 +1,20 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- mephi
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-18
|
||||
updated: 2026-05-07
|
||||
title: Наивный Байесовский Алгоритм
|
||||
---
|
||||
|
||||
# Наивный Байесовский Алгоритм
|
||||
**<u>Упрощенный алгоритм Байеса (Naive Bayes)</u>** - это алгоритм классификации, основанный на вычислении условной вероятности значений прогнозируемых атрибутов. При этом и предполагается, что входные атрибуты являются независимыми и определен хотя бы один входной атрибут.
|
||||
|
||||
Алгоритм основан на использовании формулы *Байеса*.
|
||||
- Пусть $A_{1}, A_{2}, \dots, A_{n}$ - полная группа несовместных событий, а $B$ - некоторое условие, вероятность которого **положительна**.
|
||||
- Тогда условная вероятность события $A_{i}$ при событии $B$:$$P(A_{i}|B) = \frac{P(B|A_{i})*P(A_{i})}{\Sigma_{j}P(B|A_{j})*P(A_{j})}$$
|
||||
|
||||
+23
@@ -0,0 +1,23 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- mephi
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2025-12-25
|
||||
updated: 2026-05-07
|
||||
title: Понятие Однородности Объектов
|
||||
---
|
||||
|
||||
# Понятие Однородности Объектов
|
||||
Понятие однородности объектов определяется правилом вычисления величины $\rho_{ij}$, характеризующей:
|
||||
1) расстояние между $i-ым$ и $j-ым$ объектами $d(O_i,O_{ij})$
|
||||
2) степень сходства тех же объектов $r(O_{i},O_{j})$ (процентная величина)
|
||||
|
||||
Свойства расстояний и степень сходства:
|
||||
1) Симметрия $$d(O_{i},O_{j}) = d(O_{j},O_{i})\ и\ r(O_{i},O_{j})=r(O_{j},O_{i})$$
|
||||
2) Максимальное сходство объекта с самим собой$$d(O_{i},O_{i})=0\ и\ r(O_{i},O_{i})=\max_{1\leq j \leq N}{r(O_{i},O_{j})}$$
|
||||
3) Монотонное убывание степени сходства по расстоянию $$d(O_{k},O_{j}) \geq d(O_{i},O_{j}) \to r(O_{k},O_{j}) \leq r(O_{i},O_{j})$$
|
||||
|
||||
+34
@@ -0,0 +1,34 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- mephi
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2025-12-25
|
||||
updated: 2026-05-07
|
||||
title: Постановка Задачи Кластерного Анализа
|
||||
---
|
||||
|
||||
# Постановка Задачи Кластерного Анализа
|
||||
Необходимо разбить анализируемую совокупность объектов $O = \{O_{1}, \dots, O_{N}\}$, статистически представленную в виде таблицы:$$X_{N*k}=
|
||||
\begin{pmatrix}
|
||||
x_{11} & \dots & x_{1k} \\
|
||||
\vdots & \ddots & \vdots \\
|
||||
x_{N1} & \dots & x_{Nk}
|
||||
\end{pmatrix}\ \text{или} \ \ \gamma_{N*N}= \begin{pmatrix}
|
||||
\gamma_{11} & \dots & \gamma_{1N} \\
|
||||
\vdots & \ddots & \vdots \\
|
||||
\gamma_{N1} & \dots & \gamma_{NN}
|
||||
\end{pmatrix}$$
|
||||
на сравнительно небольшое число (не обязательно известное заранее) **однородных групп/классов**.
|
||||
|
||||
## Методы решения
|
||||
- [[Агломеративные (иерархические) методы]] — объединяем объекты снизу вверх
|
||||
- [[Дивизимные методы]] — делим одну группу сверху вниз
|
||||
- [[Итерационная классификация. Метод K-средних (K-means)]] — итеративный метод с заранее заданным K
|
||||
- [[Расстояние между объектами]] — метрики близости между объектами
|
||||
- [[Расстояние между классами объектов]] — метрики близости между кластерами
|
||||
- [[Критерии определения оптимального числа классов]] — как выбрать K
|
||||
|
||||
+35
@@ -0,0 +1,35 @@
|
||||
---
|
||||
status: stable
|
||||
type: concept
|
||||
tags:
|
||||
- mephi
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-03
|
||||
updated: 2026-05-07
|
||||
title: Расстояние Между Классами Объектов
|
||||
---
|
||||
|
||||
# Расстояние Между Классами Объектов
|
||||
**Обозначения:**
|
||||
1) $\large S_{l}$ - $l-ый$ класс
|
||||
$\large i$ - порядковый номер класса
|
||||
2) $\large n_{i}$ - число объектов $\large i-ого$ класса
|
||||
3) $\large \overline{X}(i)$ - вектор средних арифметических $i-го$ класса
|
||||
4) $\large \rho(S_{l},S_{m})$ - расстояние между $l-ым$ и $m-ым$ классами
|
||||
|
||||
## Расстояния
|
||||
1) Принцип "ближайшего соседа" (расстояние Колмогорова при $\tau \to -\infty$)
|
||||
$$p_{min}(S_{l},S_{m})=\min_{\begin{gather}O_{i}\in S_{l}\\O_{j}\in S_{m}\end{gather}}d(O_{i},O_{j})$$
|
||||
2) Принцип "дальнего соседа" (расстояние Колмогорова при $\tau \to +\infty$)
|
||||
$$p_{max}(S_{l},S_{m})=\max_{\begin{gather}O_{i}\in S_{l}\\O_{j}\in S_{m}\end{gather}}d(O_{i},O_{j})$$
|
||||
3) Принцип "центров тяжести" или центров классов
|
||||
$$p_{цт}(S_{l},S_{m})=d(\overline{X}(l),\overline{X}(m))$$
|
||||
4) Принцип "средней связи" (расстояние Колмогорова при $\large \tau = 1$)
|
||||
$$\large \rho_{ср}(S_{l},S_{m})=\frac{1}{n_{l}*n_{m}}\sum\limits_{O_{i} \in S_{l}}\sum\limits_{O_{j} \in S_{m}} d(O_{i}, O_{j})$$
|
||||
5) Метод медианной связи
|
||||
Расстояние между классом $S_{l}$ и новым классом, который получили в результате объединения двух классов $S_{m}\ и\ S_{q}$, определяется как расстояние от центра класса $S_{l}$ до середины отрезка, соединяющего центры классов $S_{m}\ и\ S_{q}$
|
||||
6) Обобщенное расстояние Колмогорова - *основное расстояние классов*
|
||||
$$\rho_{\tau}^{K}(S_{l},S_{m})=\sqrt[\tau]{\frac{1}{n_{l}*n_{m}}\sum\limits_{O_{i} \in S_{l}}}\sum\limits_{O_{j} \in S_{m}} d^{\tau}(O_{i},O_{j})$$
|
||||
|
||||
+43
@@ -0,0 +1,43 @@
|
||||
---
|
||||
status: stable
|
||||
type: concept
|
||||
tags:
|
||||
- mephi
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2025-12-25
|
||||
updated: 2026-05-14
|
||||
title: Расстояние Между Объектами
|
||||
---
|
||||
|
||||
# Расстояние Между Объектами
|
||||
## Теория
|
||||
1) Евклидово расстояние (Расстояние Минковского при $p=2$) (Теорема Пифагора)
|
||||
$$d_{E}(O_{i},O_{j})=\sqrt{\sum\limits_{l=1}^{k}(x_{il}-x_{jl})^{2}}$$
|
||||
2) Взвешенное Евклидово расстояние $$d_{BE}(O_{i},O_{j})=\sqrt{\sum\limits_{l=1}^{k} \omega_{l} (x_{il}-x_{jl})^{2}},$$ $\text{где}\ \omega_{l} \in (0,1) - \text{весовой коэффициент}$
|
||||
3) Расстояние Минковского (общий случай для Евклидова и манхэттенского расстояний) $$d_{M}(O_{i},O_{j})=\sqrt[p]{\sum\limits_{l=1}^{k}|x_{il}-x_{jl}|^{p}}$$
|
||||
4) Манхэттенское расстояние (расстояние Минковского при $p=1$) $$d_{1}(O_{i},O_{j})={\sum\limits_{l=1}^{k}|x_{il}-x_{jl}|}$$
|
||||
5) Расстояние Хэмминга для бинарных векторов - число несовпадающих позиций: $$d_{H}(O_{i},O_{j})=\sum\limits_{l=1}^{k}[x_{il}\neq x_{jl}]$$
|
||||
6) Расстояние Чебышева (расстояние Минковского при $p \to \infty$) $$d_{CH}(O_{i},O_{j})={\max_{1 \leq l \leq k}|x_{il}-x_{jl}|}$$
|
||||
7) Обобщенное расстояние Махаланобиса $$d_{O}(O_{i},O_{j})=\sqrt{(O_{i}-O_{j})^{T}\Delta^{T}\Sigma^{-1}\Delta(O_{i}-O_{j})}$$
|
||||
|
||||
> $\Sigma$ - ковариационная матрица генеральной совокупности, из которой извлечена выборка.
|
||||
>
|
||||
> $\Delta$ - некоторая симметричная неотрицательно-определенная матрица весовых коэффициентов признаков.
|
||||
|
||||
8) Корреляционное расстояние
|
||||
$$d_{corr}(O_{i},O_{j}) = 1 - r_{ij}$$
|
||||
|
||||
> $r_{ij}$ - выборочный коэффициент корреляции между объектами $O_{i}, O_{j}$, соответствующие которым строки матрицы $X$ трактуются как *выборки*.
|
||||
|
||||
## Примеры
|
||||
Для точек: $O_{1}(3;2),\ O_{2}(-4;6)$
|
||||
1) $d_{E}=\sqrt{(3 - (-4))^{2}+(2-6)^{2}}=\sqrt{49+16}=\sqrt{65}$
|
||||
2) -
|
||||
3) $p=3:\ d_{m}=\sqrt[3]{|3 - (-4)|^{3}+|2-6|^{3}} = \sqrt[3]{7^{3}+4^{3}}=\dots$
|
||||
4) центр классов => среднее арифметическое собираем в одну точку
|
||||
|
||||
## Связанные заметки
|
||||
- [[Метрические алгоритмы]] — те же формулы (Евклид, Манхэттен, Минковский, Махаланобис) реализованы в sklearn; ML-нота даёт практическое применение
|
||||
- [[Итерационная классификация. Метод K-средних (K-means)]] — использует $\min_{1 \leq l \leq k} \rho_{il}$ для отнесения объекта к кластеру
|
||||
+32
@@ -0,0 +1,32 @@
|
||||
---
|
||||
status: seed
|
||||
type: concept
|
||||
tags:
|
||||
- mephi
|
||||
- math
|
||||
- statistics
|
||||
- cluster-analysis
|
||||
created: 2026-01-18
|
||||
updated: 2026-05-07
|
||||
title: Функционалы Качества Разбиения
|
||||
---
|
||||
|
||||
# Функционалы Качества Разбиения
|
||||
|
||||
При использовании разных методов кластерного анализа для одной выборки могут получиться разные разбиения.
|
||||
Для выбора "лучшего" вводятся понятия **функционалов качества разбиения**.
|
||||
|
||||
1) <u>Сумма квадратов расстояний до центров классов</u>:
|
||||
$Q_{1}(S)=\sum\limits_{l=1}^{p}\sum\limits_{O_{i} \in S_{i}}d^{2} (O_{i},\overline{X}(l)) \to \min$,
|
||||
где $p$ - число классов,
|
||||
$S_{l}$ - $l$-ый класс в классификации $S$,
|
||||
$\overline{X}(l)$ - центр класса $S_{l}$.
|
||||
2) <u>Сумма квадратов попарных внутриклассовых расстояний между объектами</u>:
|
||||
$Q_{2}(S)=\sum\limits_{l=1}^{p} \sum\limits_{O_{i},O_{j} \in S_{l}} d^{2}(O_{i},O_{j}) \to \min$
|
||||
3) <u>Суммарная внутриклассовая дисперсия</u>:
|
||||
$Q_{3}(S) = \sum\limits_{l=1}^{p}\sum\limits_{j=1}^{k}S_{j}^{2}(l) \to min$,
|
||||
где $S_{j}^{2}(l)$ - оценка дисперсии $j$-го признака $l$-го класса.
|
||||
4) <u>Отношение внутрикластерного и межкластерного расстояний</u>:
|
||||
$\frac{F_{0}}{F_{1}} \to \min$,
|
||||
где $F_{0}$ - среднее внутрикластерное расстояние ($F_{0} \to \min$),
|
||||
$F_{1}$ - среднее межкластерное расстояние ($F_{1} \to \max$)
|
||||
Reference in New Issue
Block a user