mirror of
https://github.com/ada-dmitry/CourseWork_IRFM.git
synced 2026-09-24 01:10:18 +00:00
Refactor loader and processor documentation; enhance index module with README
This commit is contained in:
@@ -211,47 +211,6 @@ prepare_text(text)
|
||||
output/uk_rf_prepared.txt
|
||||
```
|
||||
|
||||
## Предметный указатель
|
||||
## Где используется processor
|
||||
|
||||
Функция:
|
||||
|
||||
```python
|
||||
build_subject_index(text, top_n=100)
|
||||
```
|
||||
|
||||
строит индекс так:
|
||||
|
||||
1. Проходит по всем подготовленным словам.
|
||||
2. Считает частоты через `Counter`.
|
||||
3. Запоминает первое появление каждого слова: номер строки, номер символа и исходную форму слова.
|
||||
4. Возвращает 100 самых частотных слов.
|
||||
|
||||
Одна запись индекса выглядит так:
|
||||
|
||||
```python
|
||||
{
|
||||
"word": "срок",
|
||||
"count": 3342,
|
||||
"line": 34,
|
||||
"char": 151,
|
||||
"source_word": "срок",
|
||||
}
|
||||
```
|
||||
|
||||
## Запись результатов
|
||||
|
||||
Для сохранения индекса есть две функции:
|
||||
|
||||
```python
|
||||
write_subject_index_csv(entries, path)
|
||||
write_subject_index_json(entries, path)
|
||||
```
|
||||
|
||||
Они создают:
|
||||
|
||||
```text
|
||||
output/uk_rf_subject_index.csv
|
||||
output/uk_rf_subject_index.json
|
||||
```
|
||||
|
||||
CSV удобен для просмотра в таблице, JSON удобен для дальнейшей обработки программой.
|
||||
`good_words_from_line` экспортируется в `modules/index.py`, где используется для построения предметного указателя. Логика подсчёта частот и записи результатов находится в `index.py`, а не здесь.
|
||||
|
||||
Reference in New Issue
Block a user