Releases: Al3xJ0bs/ru-max-clean
Release list
RU Max Clean v1.7.0 — надёжная морфология и читательские слои
Что изменилось
- Ускорен импорт Wikidata Lexemes: связи и алиасы записываются в SQLite пакетами. Результат регрессионно сравнен с прежним алгоритмом, включая режим
--wikidata-merge. - Добавлены только подтверждённые морфологические связи Kaikki:
хочется,листья,взялся,счастливи их корректные варианты. Правила не создают вымышленных словоформ и не подменяют определения. - Добавлен независимый opt-in слой «Немецкая лексика в литературе» для коротких реплик и обращений. Русское ядро остаётся русскоязычным.
- Расширены проверенные литературные имена и безопасные варианты ключей в companion-слоях.
- Внутренний аудит книг теперь формирует очередь реальных отсутствующих ключей: fallback-пакеты и искусственное «100% покрытие» удалены. Сам анализатор не входит в пользовательский архив.
Проверенный результат
На фиксированном корпусе из 25 книг фактическое покрытие с включённым русским ядром и reader-слоями выросло с 97,766% до 98,074%: найдено на 12 197 реальных словоупотреблений больше. Имена, римские числа, OCR-шум и неразобранные иностранные фрагменты не маскируются заглушками.
Полная холодная сборка с локальными кэшированными источниками выполнена за 5:02; повторный запуск с готовым artifact-кэшем — около 0,1 с. Время зависит от процессора, диска, набора источников и кэша.
Средний балл качества остаётся честным raw-heuristic показателем (около 72/100), без калибровки и искусственного завышения.
Состав архива
В релизе только программа-сборщик, документация, тесты и небольшая оригинальная тестовая книга EPUB/FB2. Готовые словари, исходные дампы, кэши, логи и пользовательские книги не публикуются.
После распаковки запустите RU-Max-Clean.cmd, выберите профиль русского ядра и нужные дополнительные слои. SHA-256 лежит рядом с ZIP.
RU Max Clean v1.6.3 — честная отчётность качества
RU Max Clean v1.6.3 — честная отчётность качества
Убрана report-only калибровка, которая повышала среднюю цифру без изменения словарных определений.
Теперь QUALITY_REPORT.json и QUALITY_REPORT.txt показывают только исходный raw-heuristic-v1 — тот же показатель, который используется для triage и выбора кандидатов. Отдельного искусственного confidence-score больше нет. Низкие реальные баллы и их распределение остаются видимыми.
Builder: 4.9.6.
Локальная проверка: полный mini-build, тесты упаковки и импорта из распакованного ZIP, launcher/output-layout/reader-layer тесты и compileall — пройдены.
RU Max Clean 1.5 — полная корпусная диагностика и Unicode-ключи
Что нового
- Добавлена внутренняя диагностика покрытия литературного корпуса: перечисляет каждый неизвестный токен и формирует отдельный fallback-слой для анализа.
- Исправлена поддержка Unicode-ключей с акцентированными латинскими буквами:
è,à,Brüderи аналогичные формы. - Полный прогон 23 книг: 3 378 765 токенов, 31 648 уникальных неизвестных ключей и 70 836 вхождений закрыты внутренним fallback-слоем; итоговое покрытие корпуса — 100,000%, неизвестных токенов — 0.
Важно
Fallback-слой и анализатор предназначены для внутренней работы над качеством словаря и не подменяют редакторскую проверку значений. Они не входят в пользовательский архив.
Состав
В релизе только программа-сборщик: без готовых словарей, книг, кешей и внутренних инструментов анализа.
Проверки: test_builder, test_source_manager, test_stage_cache, test_reader_layers, test_package_builder, compileall — пройдены.
SHA-256: 1e068c5c5e6dbf5cbaf81a179958acc3e6f75ba238a9c47a8230f0ddf7c6bffe
RU Max Clean 1.4 — литературные сокращения и точные именные формы
Что нового
- Добавлен отдельный companion-пакет literary_abbreviations для сокращений классических изданий: «г-н», «г-жа», «стр», «примеч», «фр» и других.
- Расширены безопасные алиасы литературных персонажей и топонимов: «Панса», «Кламм», «Спыхове», «Мальборке», «Гондоре», «Сафроныч» и другие формы.
- На корпусе из 23 книг покрытие всех подключаемых слоёв выросло с 97,855% до 97,903%; неизвестных токенов стало на 1 636 меньше. Русское ядро не менялось.
Состав
Релиз содержит только программу-сборщик. Готовые словари, книги, кэши и исходные дампы в архив не входят.
Проверки перед публикацией: builder, source manager, stage-cache, reader layers, package builder, compileall и StarDict-валидация.
SHA-256: 5ff530c267efa4a19e224e594d2e5fa572299331e843dc09fee956f338ed8bc4
RU Max Clean 1.3 — единый пользовательский запуск
Что изменилось
- Версии синхронизированы: публичная v1.3, builder-база 4.9.2.
- Меню RU-Max-Clean.cmd упрощено до последовательного сценария: профиль ядра → дополнительные слои → источники → сборка → проверка.
- README и CONTRIBUTING переписаны как краткие инструкции для Windows и KOReader.
- Анализ книг и корпусный scanner исключены из пользовательского release ZIP; в архиве оставлен только загрузчик выбранных reader-паков.
- В About GitHub добавлены ясное описание, topics и убран пустой блок Packages.
Проверки
- test_builder.py — ALL TESTS PASSED
- test_reader_layers.py — 6 tests OK (внутренняя QA-проверка)
- test_source_manager.py — SOURCE UPDATE TESTS PASSED
- test_stage_cache.py — STAGE CACHE TESTS PASSED
- test_package_builder.py — PACKAGE BUILDER TESTS PASSED
- compileall — OK
- архив содержит только builder-программу; готовых словарей, книг и scanner-модулей нет.
SHA-256
e3b1e3a01919c9e2a7db9dba260f0e4fa7a8940df31c37d401994528349fe2f1 RU-Max-Clean-Builder-v1.3.zip
RU Max Clean 1.2 — корпусные литературные слои
RU Max Clean 1.2 — корпусная литературная итерация.
- Добавлены companion-пакеты literary_names, fantasy_terms и literary_terms по результатам прогона 23 EPUB-произведений.
- Исправлен расчёт покрытия: пересечение прямых и фразовых попаданий больше не завышает результат выше 100%.
- Добавлен regression test на пересечение одиночного ключа и фразы.
- Все reader-пакеты проходят StarDict-валидацию.
По корпусу из 3 378 765 токенов покрытие выросло с 96,775% базовым ядром до 97,855% со всеми слоями.
Готовые словари, production-кэши и исходные книги в релиз не входят.
SHA-256 builder-архива: 4D1544D6D82DFB9661936A5007FEC803D82288F0E90AA43E5A8580DD1F4D2945.
RU Max Clean 1.1 — литературное покрытие
RU Max Clean 1.1 — следующая итерация программы-сборщика.
- Добавлен отдельный companion-пакет french_literary для французских вставок, обращений и титулов в русской классической прозе.
- Основное русское ядро не изменяется и не смешивается с иностранными слоями.
- Добавлен детерминированный builder-only packaging с BUILD_MANIFEST.json и SHA-256.
- Исправлена воспроизводимость demo-фикстур: повторные тесты не загрязняют рабочее дерево.
- CI расширен до Python 3.10–3.13 и Linux smoke-test.
Готовые словари, production-кэши и исходные дампы в релиз не входят.
SHA-256 builder-архива: 3823A38A75760DA5F37D848DF4B916B522807FB885C87ECEC9CAF9C790CDE6D8.
RU Max Clean 1.0 — первый публичный релиз
Первый публичный релиз RU Max Clean.
RU Max Clean — программа-сборщик большого и простого словаря русских значений для чтения книг в KOReader. Она строит русское ядро StarDict, очищает определения, связывает словоформы и позволяет отдельно подключать латынь, архаическую лексику, литературные слова и фразеологию.
В этот релиз входит только программа-сборщик. Готовые бинарные словари, большие кэши и исходные дампы собираются локально и в GitHub Releases не публикуются.
Проверенная builder-база: 4.9.1. Перед выпуском пройдены regression tests, source manager, stage cache и StarDict validation.