backup: 2026-04-17 11:28

This commit is contained in:
Dmitry
2026-04-17 11:28:35 +03:00
commit 21a95ec314
653 changed files with 244637 additions and 0 deletions
@@ -0,0 +1,44 @@
---
status: seed
type: concept
tags:
- math
- mephi
created: 2026-01-18
updated: 2026-02-27
title: Агломеративные (иерархические) Методы
---
# Агломеративные (иерархические) Методы
Принцип работы агломеративных методов кластеризации заключается в последовательном объединении групп наиболее приближенных объектов, а потом всё более далеких друг от друга.
На первом шаге, каждый объект - отдельный класс.
На каждом последующем, мы объединяем самые близкие классы в один.
Алгоритм заканчивается, когда остается всего один класс.
Если ставится задача разбиения на несколько кластеров, то устанавливается пороговое значение расстояния $\rho$, превышение которого прекращает цикл.
## Алгоритм
1) Центрирование и нормирование значений исходных признаков
2) Расчет матрицы расстояний между объектами (каждый объект - отдельный класс)
3) Объединение двух ближайших классов
4) Пересчет матрицы расстояний между классами ([[Расстояние между классами объектов|по выбранному методу]])
5) Повторение процедуры до достижения необходимого количества классов
## Методы Связывания Классов
1) <u>Одиночная связь</u> (метод ближайшего соседа)
Расстояние между кластерами определяется, как расстояние между двумя наиболее близкими объектами в этих кластерах. Такие кластеры имеют тенденцию представляться в виде *"цепочек"*.
2) <u>Полная связь</u> (метод дальнего соседа)
Наибольшее расстояние между двумя объектами из разных кластеров. (Но из этих "максимальных расстояний" выбираем минимальное)
3) <u>Невзвешенное попарное среднее</u>
Расстояние вычисляется как **среднее расстояние между всеми парами** объектов в двух классах.
4) <u>Взвешенное попарное среднее</u>
Аналогично невзвешенному, но предполагаются неравные размеры кластеров, поэтому размер кластера (т.е. число объектов в нем) используется в качестве весового коэффициента.
5) <u>Невзвешенный центроидный метод</u>
Расстояние м/у двумя кластерами определяется как расстояние между их центрами тяжести.
6) <u>Взвешенный центроидный метод</u>
Аналогично невзвешенному, но при вычислениях используются веса для учета разницы между кластерами.
7) **<u>Метод Уорда</u>**
Использует методы дисперсионного анализа для оценки расстояний между кластерами. Метод минимизирует сумму квадратов $(SS)$ для любых двух кластеров, которые могут быть сформированы на каждом шаге.
*Метод эффективен, но стремиться к кластерам малого размера.*
@@ -0,0 +1,20 @@
---
status: seed
type: concept
tags: []
created: 2026-01-18
updated: 2026-02-27
title: Дивизимные Методы
---
# Дивизимные Методы
> Принцип работы обратен [[Агломеративные (иерархические) методы|Агломерации]].
Первоначально все объекты в одном кластере, выбираются два **наиболее** удаленных объекта, и их берут за основу двух новых кластеров.
Далее, остальные объекты распределяют по этим классам по принципу наименьшего расстояния до его центра.
Далее уже эти два класса делят на 4 по тому же принципу.
<u>Цикл происходит до тех пор, пока каждый объект не станет отдельный классом.</u>
Преимущество дивизимных методов заключается в том, что все расчеты осуществляются на основе исходной **матрицы расстояний**, не нуждающейся в постоянном пересчете.
@@ -0,0 +1,20 @@
---
status: seed
type: concept
tags:
- math
- mephi
created: 2026-01-18
updated: 2026-02-27
title: Интерпретация Результатов Кластеризации
---
# Интерпретация Результатов Кластеризации
1) <u>Анализ средних значений</u>
- *Расчет* *средних*:
Для каждого выделенного кластера вычисляются средние значения всех признаков, участвовавших в классификации.
- *Визуализация*:
Строятся графики средних значений (профили кластеров). Благодаря своей наглядности, они позволяют охарактеризовать каждый класс и провести сравнительный анализ между группами.
- *Присвоение имен*:
Конечной целью этого этапа является присвоение каждому кластеру понятного названия, отражающего его специфику (например, "клиенты с высоким доходом", "рискованные заемщики" и т.д.).
@@ -0,0 +1,44 @@
---
status: seed
type: concept
tags:
- mephi
- math
created: 2026-01-05
updated: 2026-02-27
title: Итерационные Методы
---
# Итерационные Методы
Процедуры классификации, которые, в отличие от иерархических методов, не строят дерево (дендрограмму), а разбивают совокупность объектов на кластеры путем последовательного улучшения начального разбиения.
# К-средних
Метод K-средних относится к методам итерационной классификации. В результате строится ровно $k$ различных, наиболее удаленных друг от друга, кластеров.
> [!important] Цель метода
> **Минимизировать** изменчивость внутри кластеров и **максимизировать** изменчивость между кластерами.
Объекты перемещаются из одних кластеров в другие для того, чтобы получить наиболее значимый результат: **максимальное отношение межгрупповой дисперсии к внутригрупповой.**
## Алгоритм
1) Задаются $k$ случайно выбранных объектов (число классов) - эталоны $\epsilon$
2) Из оставшихся $N-k$ объектов извлекается объект и проверяется, к какому их эталонов он ближе (по мерам расстояния). Данных объект присоединяется к тому эталону, для которого наблюдается минимальное расстояние $\min_{1 \leq l \leq k} \rho_{il}$
Веса и эталоны пересчитываются по принципу:
$$\begin{align}
\epsilon_{i} = \begin{cases}
\frac{\omega_{i}*\epsilon_{i}+O}{\omega_{i}+1},\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\
\epsilon_{i},\ \text{в других случаях}
\end{cases}
\\
\omega_{i} = \begin{cases}
\omega_{i}+1,\ если\ \rho(O, \epsilon_{i})=\min_{1 \leq j \leq k} \epsilon_{j} \\
\omega_{i},\ \text{в других случаях}
\end{cases}
\end{align}$$
$\omega_{i}$ - вес $i-го$ класса. Изначально считается, что $\epsilon_{i}=O_{i},\ \omega_{i}=1,\ i=\overline{1,k}$
3) После рассмотрения каждого из $N-k$ объектов, все объекты будут распределены на $k$ классов - на этом первая итерация алгоритма закончена.
4) Для достижения устойчивого разбиения, итерация повторяется, а веса продолжают накапливаться. Новое разбиение сравнивается с предыдущим. Если совпадают, то работа алгоритма завершается, в противном случае - алгоритм повторяется.
Недостатками метода можно отметить:
- неясно, как выбирать исходные центры кластеров.
- число кластеров надо знать заранее.
@@ -0,0 +1,39 @@
---
status: seed
type: concept
tags:
- mephi
created: 2025-12-25
updated: 2026-02-27
title: Классификация
---
# Классификация
> [!note] Определение
> Классификация - это:
> 1) разделение рассматриваемой совокупности объектов/явлений на **однородные группы**
> 2) отнесение каждого из заданного множества объектов к одному из заранее известных классов
## Исходные Статистические Данные В Задачах Классификации
1) Матрица "**объект-свойство**" или матрица парных сравнений:$$X_{N*k}=
\begin{pmatrix}
x_{11} & \dots & x_{1k} \\
\vdots & \ddots & \vdots \\
x_{N1} & \dots & x_{Nk}
\end{pmatrix}\ \text{или} \ \ \gamma_{N*N}= \begin{pmatrix}
\gamma_{11} & \dots & \gamma_{1N} \\
\vdots & \ddots & \vdots \\
\gamma_{N1} & \dots & \gamma_{NN}
\end{pmatrix}$$
2) Обучающие выборки $X^{(1)}, X^{(2)}, \dots, X^{(p)}$ -> набор объектов, для которых заранее известно к каким классам они относятся:$$X_{n_{j}*k}^{(j)}=
\begin{pmatrix} x_{11}^{(j)} & \dots & x_{1k}^{(j)} \\ \vdots & \ddots & \vdots \\ x_{n_{j}1}^{(j)} & \dots & x_{n_{j}k}^{(j)}
\end{pmatrix},\ \text{где}\ j=\overline{1,p}$$
## Типологизация Задач Классификации
| Априорные сведения о классах | Без обучающих выборок | С обучающими выборками |
| --------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------- | -------------------------------------------------------------------------------------------------------- |
| Не известен вид закона распределения в классах | Классификация без обучения (непараметрический случай): <u>**кластерный анализ**</u> | Классификация с обучением (непараметрический случай): **<u>дискриминантный анализ</u>** |
| Известен вид закона распределения в классах (***параметра распределения не известны***) | Классификация без обучения (параметрический случай) <u>**расщепление смесей вероятностных распределений**</u> | Классификация с обучением (параметрический случай) <u>**параметрический дискриминантный анализ**</u><br> |
| Полностью известен закон распределения в классах | Проверка статических гипотез | Обучающие выборки не нужны |
@@ -0,0 +1,18 @@
---
status: seed
type: concept
tags: []
created: 2026-01-18
updated: 2026-02-27
title: Критерии Определения Оптимального Числа Классов
---
# Критерии Определения Оптимального Числа Классов
1) <u>Визуальный анализ дендрограммы</u>:
Большой разрыв между уровнями разбиения $\rho_{0}$ и $\rho_{1}>\rho_{0}$ говорит о том, что оптимальное количество классов равно $\rho_{0}$
2) <u>Формальные статистические критерии</u>:
- *Индекс Калински и Харабаза* (сравнение разброса внутри кластеров с разбросом между кластерами)
$G = \frac{trace(B)/(p-1)}{trace(W)/(n-p)}$, где $B$ - матрица межгруппового рассеяния, $W$ - матрица внутригруппового рассеяния, $p$ - кол-во классов, $n$ - объем выборки.
Оптимальным считается разбиение, когда индекс принимает **максимальное значение**.
- *Индекс Дуды и Харта*
1) [[Функционалы качества разбиения]]
@@ -0,0 +1,18 @@
---
status: seed
type: concept
tags:
- mephi
- math
created: 2026-01-18
updated: 2026-02-27
title: Наивный Байесовский Алгоритм
---
# Наивный Байесовский Алгоритм
**<u>Упрощенный алгоритм Байеса (Naive Bayes)</u>** - это алгоритм классификации, основанный на вычислении условной вероятности значений прогнозируемых атрибутов. При этом и предполагается, что входные атрибуты являются независимыми и определен хотя бы один входной атрибут.
Алгоритм основан на использовании формулы *Байеса*.
- Пусть $A_{1}, A_{2}, \dots, A_{n}$ - полная группа несовместных событий, а $B$ - некоторое условие, вероятность которого **положительна**.
- Тогда условная вероятность события $A_{i}$ при событии $B$:$$P(A_{i}|B) = \frac{P(B|A_{i})*P(A_{i})}{\Sigma_{j}P(B|A_{j})*P(A_{j})}$$
@@ -0,0 +1,20 @@
---
status: seed
type: concept
tags:
- mephi
created: 2025-12-25
updated: 2026-02-27
title: Понятие Однородности Объектов
---
# Понятие Однородности Объектов
Понятие однородности объектов определяется правилом вычисления величины $\rho_{ij}$, характеризующей:
1) расстояние между $i-ым$ и $j-ым$ объектами $d(O_i,O_{ij})$
2) степень сходства тех же объектов $r(O_{i},O_{j})$ (процентная величина)
Свойства расстояний и степень сходства:
1) Симметрия $$d(O_{i},O_{j}) = d(O_{j},O_{i})\ и\ r(O_{i},O_{j})=r(O_{j},O_{i})$$
2) Максимальное сходство объекта с самим собой$$d(O_{i},O_{i})=0\ и\ r(O_{i},O_{i})=\max_{1\leq j \leq N}{r(O_{i},O_{j})}$$
3) Монотонное убывание степени сходства по расстоянию $$d(O_{k},O_{j}) \geq d(O_{i},O_{j}) \to r(O_{k},O_{j}) \leq r(O_{i},O_{j})$$
@@ -0,0 +1,23 @@
---
status: seed
type: concept
tags:
- mephi
created: 2025-12-25
updated: 2026-02-27
title: Постановка Задачи Кластерного Анализа
---
# Постановка Задачи Кластерного Анализа
Необходимо разбить анализируемую совокупность объектов $O = \{O_{1}, \dots, O_{N}\}$, статистически представленную в виде таблицы:$$X_{N*k}=
\begin{pmatrix}
x_{11} & \dots & x_{1k} \\
\vdots & \ddots & \vdots \\
x_{N1} & \dots & x_{Nk}
\end{pmatrix}\ \text{или} \ \ \gamma_{N*N}= \begin{pmatrix}
\gamma_{11} & \dots & \gamma_{1N} \\
\vdots & \ddots & \vdots \\
\gamma_{N1} & \dots & \gamma_{NN}
\end{pmatrix}$$
на сравнительно небольшое число (не обязательно известное заранее) **однородных групп/классов**.
@@ -0,0 +1,33 @@
---
status: stable
type: concept
tags:
- mephi
- math
created: 2026-01-03
updated: 2026-02-27
title: Расстояние Между Классами Объектов
---
# Расстояние Между Классами Объектов
**Обозначения:**
1) $\large S_{l}$ - $l-ый$ класс
$\large i$ - порядковый номер класса
2) $\large n_{i}$ - число объектов $\large i-ого$ класса
3) $\large \overline{X}(i)$ - вектор средних арифметических $i-го$ класса
4) $\large \rho(S_{l},S_{m})$ - расстояние между $l-ым$ и $m-ым$ классами
## Расстояния
1) Принцип "ближайшего соседа" (расстояние Колмогорова при $\tau \to -\infty$)
$$p_{min}(S_{l},S_{m})=\min_{\begin{gather}O_{i}\in S_{l}\\O_{j}\in S_{m}\end{gather}}d(O_{i},O_{j})$$
2) Принцип "дальнего соседа" (расстояние Колмогорова при $\tau \to +\infty$)
$$p_{max}(S_{l},S_{m})=\max_{\begin{gather}O_{i}\in S_{l}\\O_{j}\in S_{m}\end{gather}}d(O_{i},O_{j})$$
3) Принцип "центров тяжести" или центров классов
$$p_{цт}(S_{l},S_{m})=d(\overline{X}(l),\overline{X}(m))$$
4) Принцип "средней связи" (расстояние Колмогорова при $\large \tau = 1$)
$$\large \rho_{ср}(S_{l},S_{m})=\frac{1}{n_{l}*n_{m}}\sum\limits_{O_{i} \in S_{l}}\sum\limits_{O_{j} \in S_{m}} d(O_{i}, O_{j})$$
5) Метод медианной связи
Расстояние между классом $S_{l}$ и новым классом, который получили в результате объединения двух классов $S_{m}\ и\ S_{q}$, определяется как расстояние от центра класса $S_{l}$ до середины отрезка, соединяющего центры классов $S_{m}\ и\ S_{q}$
6) Обобщенное расстояние Колмогорова - *основное расстояние классов*
$$\rho_{\tau}^{K}(S_{l},S_{m})=\sqrt[\tau]{\frac{1}{n_{l}*n_{m}}\sum\limits_{O_{i} \in S_{l}}}\sum\limits_{O_{j} \in S_{m}} d^{\tau}(O_{i},O_{j})$$
@@ -0,0 +1,36 @@
---
status: stable
type: concept
tags:
- mephi
created: 2025-12-25
updated: 2026-02-27
title: Расстояние Между Объектами
---
# Расстояние Между Объектами
## Теория
1) Евклидово расстояние (Расстояние Минковского при $p=2$) (Теорема Пифагора)
$$d_{E}(O_{i},O_{j})=\sqrt{\sum\limits_{l=1}^{k}(x_{il}-x_{jl})^{2}}$$
2) Взвешенное Евклидово расстояние $$d_{BE}(O_{i},O_{j})=\sqrt{\sum\limits_{l=1}^{k} \omega_{l} (x_{il}-x_{jl})^{2}},$$ $\text{где}\ \omega_{l} \in (0,1) - \text{весовой коэффициент}$
3) Расстояние Минковского (общий случай для Евклидового и Хеммингово расстояние) $$d_{M}(O_{i},O_{j})=\sqrt[p]{\sum\limits_{l=1}^{k}|x_{il}-x_{jl}|^{p}}$$
4) Хеммингово (манхэттенское) расстояние (расстояние Минковского при $p=1$) $$d_{H}(O_{i},O_{j})={\sum\limits_{l=1}^{k}|x_{il}-x_{jl}|}$$
5) Расстояние Чебышева (расстояние Минковского при $p \to \infty$) $$d_{CH}(O_{i},O_{j})={\max_{1 \leq l \leq k}|x_{il}-x_{jl}|}$$
6) Обобщенное расстояние Махаланобиса $$d_{O}(O_{i},O_{j})=\sqrt{(O_{i}-O_{j})^{T}\Delta^{T}\Sigma^{-1}\Delta(O_{i}-O_{j})}$$
> $\Sigma$ - ковариационная матрица генеральной совокупности, из которой извлечена выборка.
>
> $\Delta$ - некоторая симметричная неотрицательно-определенная матрица весовых коэффициентов признаков.
7) Корреляционное расстояние
$$d_{corr}(O_{i},O_{j}) = 1 - r_{ij}$$
> $r_{ij}$ - выборочный коэффициент корреляции между объектами $O_{i}, O_{j}$, соответствующие которым строки матрицы $X$ трактуются как *выборки*.
## Примеры
Для точек: $O_{1}(3;2),\ O_{2}(-4;6)$
1) $d_{E}=\sqrt{(3 - (-4))^{2}+(2-6)^{2}}=\sqrt{49+16}=\sqrt{65}$
2) -
3) $p=3:\ d_{m}=\sqrt[3]{|3 - (-4)|^{3}+|2-6|^{3}} = \sqrt[3]{7^{3}+4^{3}}=\dots$
4) центр классов => среднее арифметическое собираем в одну точку
@@ -0,0 +1,30 @@
---
status: seed
type: concept
tags:
- mephi
- math
created: 2026-01-18
updated: 2026-02-27
title: Функционалы Качества Разбиения
---
# Функционалы Качества Разбиения
При использовании разных методов кластерного анализа для одной выборки могут получиться разные разбиения.
Для выбора "лучшего" вводятся понятия **функционалов качества разбиения**.
1) <u>Сумма квадратов расстояний до центров классов</u>:
$Q_{1}(S)=\sum\limits_{l=1}^{p}\sum\limits_{O_{i} \in S_{i}}d^{2} (O_{i},\overline{X}(l)) \to \min$,
где $p$ - число классов,
$S_{l}$ - $l$-ый класс в классификации $S$,
$\overline{X}(l)$ - центр класса $S_{l}$.
2) <u>Сумма квадратов попарных внутриклассовых расстояний между объектами</u>:
$Q_{2}(S)=\sum\limits_{l=1}^{p} \sum\limits_{O_{i},O_{j} \in S_{l}} d^{2}(O_{i},O_{j}) \to \min$
3) <u>Суммарная внутриклассовая дисперсия</u>:
$Q_{3}(S) = \sum\limits_{l=1}^{p}\sum\limits_{j=1}^{k}S_{j}^{2}(l) \to min$,
где $S_{j}^{2}(l)$ - оценка дисперсии $j$-го признака $l$-го класса.
4) <u>Отношение внутрикластерного и межкластерного расстояний</u>:
$\frac{F_{0}}{F_{1}} \to \min$,
где $F_{0}$ - среднее внутрикластерное расстояние ($F_{0} \to \min$),
$F_{1}$ - среднее межкластерное расстояние ($F_{1} \to \max$)