Refactor loader and processor documentation; enhance index module with README

This commit is contained in:
Dmitry
2026-04-28 21:04:24 +03:00
parent 29e1ee26fb
commit 045fc41660
7 changed files with 104 additions and 55 deletions
+2 -43
View File
@@ -211,47 +211,6 @@ prepare_text(text)
output/uk_rf_prepared.txt
```
## Предметный указатель
## Где используется processor
Функция:
```python
build_subject_index(text, top_n=100)
```
строит индекс так:
1. Проходит по всем подготовленным словам.
2. Считает частоты через `Counter`.
3. Запоминает первое появление каждого слова: номер строки, номер символа и исходную форму слова.
4. Возвращает 100 самых частотных слов.
Одна запись индекса выглядит так:
```python
{
"word": "срок",
"count": 3342,
"line": 34,
"char": 151,
"source_word": "срок",
}
```
## Запись результатов
Для сохранения индекса есть две функции:
```python
write_subject_index_csv(entries, path)
write_subject_index_json(entries, path)
```
Они создают:
```text
output/uk_rf_subject_index.csv
output/uk_rf_subject_index.json
```
CSV удобен для просмотра в таблице, JSON удобен для дальнейшей обработки программой.
`good_words_from_line` экспортируется в `modules/index.py`, где используется для построения предметного указателя. Логика подсчёта частот и записи результатов находится в `index.py`, а не здесь.