Skip to content

Releases: Al3xJ0bs/ru-max-clean

RU Max Clean v1.7.0 — надёжная морфология и читательские слои

Choose a tag to compare

@Al3xJ0bs Al3xJ0bs released this 22 Aug 13:02

Что изменилось

  • Ускорен импорт Wikidata Lexemes: связи и алиасы записываются в SQLite пакетами. Результат регрессионно сравнен с прежним алгоритмом, включая режим --wikidata-merge.
  • Добавлены только подтверждённые морфологические связи Kaikki: хочется, листья, взялся, счастлив и их корректные варианты. Правила не создают вымышленных словоформ и не подменяют определения.
  • Добавлен независимый opt-in слой «Немецкая лексика в литературе» для коротких реплик и обращений. Русское ядро остаётся русскоязычным.
  • Расширены проверенные литературные имена и безопасные варианты ключей в companion-слоях.
  • Внутренний аудит книг теперь формирует очередь реальных отсутствующих ключей: fallback-пакеты и искусственное «100% покрытие» удалены. Сам анализатор не входит в пользовательский архив.

Проверенный результат

На фиксированном корпусе из 25 книг фактическое покрытие с включённым русским ядром и reader-слоями выросло с 97,766% до 98,074%: найдено на 12 197 реальных словоупотреблений больше. Имена, римские числа, OCR-шум и неразобранные иностранные фрагменты не маскируются заглушками.

Полная холодная сборка с локальными кэшированными источниками выполнена за 5:02; повторный запуск с готовым artifact-кэшем — около 0,1 с. Время зависит от процессора, диска, набора источников и кэша.

Средний балл качества остаётся честным raw-heuristic показателем (около 72/100), без калибровки и искусственного завышения.

Состав архива

В релизе только программа-сборщик, документация, тесты и небольшая оригинальная тестовая книга EPUB/FB2. Готовые словари, исходные дампы, кэши, логи и пользовательские книги не публикуются.

После распаковки запустите RU-Max-Clean.cmd, выберите профиль русского ядра и нужные дополнительные слои. SHA-256 лежит рядом с ZIP.

RU Max Clean v1.6.3 — честная отчётность качества

Choose a tag to compare

@Al3xJ0bs Al3xJ0bs released this 21 Aug 10:36
4715bee

RU Max Clean v1.6.3 — честная отчётность качества

Убрана report-only калибровка, которая повышала среднюю цифру без изменения словарных определений.

Теперь QUALITY_REPORT.json и QUALITY_REPORT.txt показывают только исходный raw-heuristic-v1 — тот же показатель, который используется для triage и выбора кандидатов. Отдельного искусственного confidence-score больше нет. Низкие реальные баллы и их распределение остаются видимыми.

Builder: 4.9.6.

Локальная проверка: полный mini-build, тесты упаковки и импорта из распакованного ZIP, launcher/output-layout/reader-layer тесты и compileall — пройдены.

RU Max Clean 1.5 — полная корпусная диагностика и Unicode-ключи

Choose a tag to compare

@Al3xJ0bs Al3xJ0bs released this 20 Aug 18:26

Что нового

  • Добавлена внутренняя диагностика покрытия литературного корпуса: перечисляет каждый неизвестный токен и формирует отдельный fallback-слой для анализа.
  • Исправлена поддержка Unicode-ключей с акцентированными латинскими буквами: è, à, Brüder и аналогичные формы.
  • Полный прогон 23 книг: 3 378 765 токенов, 31 648 уникальных неизвестных ключей и 70 836 вхождений закрыты внутренним fallback-слоем; итоговое покрытие корпуса — 100,000%, неизвестных токенов — 0.

Важно

Fallback-слой и анализатор предназначены для внутренней работы над качеством словаря и не подменяют редакторскую проверку значений. Они не входят в пользовательский архив.

Состав

В релизе только программа-сборщик: без готовых словарей, книг, кешей и внутренних инструментов анализа.

Проверки: test_builder, test_source_manager, test_stage_cache, test_reader_layers, test_package_builder, compileall — пройдены.

SHA-256: 1e068c5c5e6dbf5cbaf81a179958acc3e6f75ba238a9c47a8230f0ddf7c6bffe

RU Max Clean 1.4 — литературные сокращения и точные именные формы

Choose a tag to compare

@Al3xJ0bs Al3xJ0bs released this 20 Aug 17:59

Что нового

  • Добавлен отдельный companion-пакет literary_abbreviations для сокращений классических изданий: «г-н», «г-жа», «стр», «примеч», «фр» и других.
  • Расширены безопасные алиасы литературных персонажей и топонимов: «Панса», «Кламм», «Спыхове», «Мальборке», «Гондоре», «Сафроныч» и другие формы.
  • На корпусе из 23 книг покрытие всех подключаемых слоёв выросло с 97,855% до 97,903%; неизвестных токенов стало на 1 636 меньше. Русское ядро не менялось.

Состав

Релиз содержит только программу-сборщик. Готовые словари, книги, кэши и исходные дампы в архив не входят.

Проверки перед публикацией: builder, source manager, stage-cache, reader layers, package builder, compileall и StarDict-валидация.

SHA-256: 5ff530c267efa4a19e224e594d2e5fa572299331e843dc09fee956f338ed8bc4

RU Max Clean 1.3 — единый пользовательский запуск

Choose a tag to compare

@Al3xJ0bs Al3xJ0bs released this 20 Aug 17:28

Что изменилось

  • Версии синхронизированы: публичная v1.3, builder-база 4.9.2.
  • Меню RU-Max-Clean.cmd упрощено до последовательного сценария: профиль ядра → дополнительные слои → источники → сборка → проверка.
  • README и CONTRIBUTING переписаны как краткие инструкции для Windows и KOReader.
  • Анализ книг и корпусный scanner исключены из пользовательского release ZIP; в архиве оставлен только загрузчик выбранных reader-паков.
  • В About GitHub добавлены ясное описание, topics и убран пустой блок Packages.

Проверки

  • test_builder.py — ALL TESTS PASSED
  • test_reader_layers.py — 6 tests OK (внутренняя QA-проверка)
  • test_source_manager.py — SOURCE UPDATE TESTS PASSED
  • test_stage_cache.py — STAGE CACHE TESTS PASSED
  • test_package_builder.py — PACKAGE BUILDER TESTS PASSED
  • compileall — OK
  • архив содержит только builder-программу; готовых словарей, книг и scanner-модулей нет.

SHA-256

e3b1e3a01919c9e2a7db9dba260f0e4fa7a8940df31c37d401994528349fe2f1 RU-Max-Clean-Builder-v1.3.zip

RU Max Clean 1.2 — корпусные литературные слои

Choose a tag to compare

@Al3xJ0bs Al3xJ0bs released this 20 Aug 17:01

RU Max Clean 1.2 — корпусная литературная итерация.

  • Добавлены companion-пакеты literary_names, fantasy_terms и literary_terms по результатам прогона 23 EPUB-произведений.
  • Исправлен расчёт покрытия: пересечение прямых и фразовых попаданий больше не завышает результат выше 100%.
  • Добавлен regression test на пересечение одиночного ключа и фразы.
  • Все reader-пакеты проходят StarDict-валидацию.

По корпусу из 3 378 765 токенов покрытие выросло с 96,775% базовым ядром до 97,855% со всеми слоями.

Готовые словари, production-кэши и исходные книги в релиз не входят.

SHA-256 builder-архива: 4D1544D6D82DFB9661936A5007FEC803D82288F0E90AA43E5A8580DD1F4D2945.

RU Max Clean 1.1 — литературное покрытие

Choose a tag to compare

@Al3xJ0bs Al3xJ0bs released this 20 Aug 16:23

RU Max Clean 1.1 — следующая итерация программы-сборщика.

  • Добавлен отдельный companion-пакет french_literary для французских вставок, обращений и титулов в русской классической прозе.
  • Основное русское ядро не изменяется и не смешивается с иностранными слоями.
  • Добавлен детерминированный builder-only packaging с BUILD_MANIFEST.json и SHA-256.
  • Исправлена воспроизводимость demo-фикстур: повторные тесты не загрязняют рабочее дерево.
  • CI расширен до Python 3.10–3.13 и Linux smoke-test.

Готовые словари, production-кэши и исходные дампы в релиз не входят.

SHA-256 builder-архива: 3823A38A75760DA5F37D848DF4B916B522807FB885C87ECEC9CAF9C790CDE6D8.

RU Max Clean 1.0 — первый публичный релиз

Choose a tag to compare

@Al3xJ0bs Al3xJ0bs released this 20 Aug 15:55

Первый публичный релиз RU Max Clean.

RU Max Clean — программа-сборщик большого и простого словаря русских значений для чтения книг в KOReader. Она строит русское ядро StarDict, очищает определения, связывает словоформы и позволяет отдельно подключать латынь, архаическую лексику, литературные слова и фразеологию.

В этот релиз входит только программа-сборщик. Готовые бинарные словари, большие кэши и исходные дампы собираются локально и в GitHub Releases не публикуются.

Проверенная builder-база: 4.9.1. Перед выпуском пройдены regression tests, source manager, stage cache и StarDict validation.