PRISM v1.2.0 — сводный лидерборд A/B, перенос модуля статистики
[1.2.0] — 2026-06-26
Подача лидерборда: сводка для беглого взгляда, мера неопределённости и цветовой профиль.
Метрика и банк задач не менялись — оценки из 1.1.0 сравнимы напрямую.
Добавлено
- Сводный лидерборд A/B — для каждой модели доля заданий, решённых целиком (код
прошёл все скрытые проверки), отдельно по алгоритмике (A) и платформе (B), с рангом и
цветовой полосой (🟩 решено целиком · 🟥 нет). Категории не усредняются — это разные навыки.
В README и на странице «Лидерборд». - Колонка «± погрешность» в детальных таблицах S·M·O·(P)·Q — полуширина 95%
доверительного интервала Q по задачам. Простым языком: больше → модель нестабильна,
меньше → ровная; пока задач мало, погрешность велика и близкие модели наравне. Точный
интервал и термин «ДИ» — дляleaderboard --fullи методики. - Профиль по навыкам — теплокарта: цвет по уровню балла (🟩 ≥7 · 🟨 4–7 · 🟥 <4) плюс
число, вместо голой матрицы. Видно с первого взгляда, с чем модель сильна, с чем слаба. - Модуль сводной статистики
harness/stats/summary— среднее, медиана, σ и 95% ДИ
(t-распределение для малых выборок, нормальное приближение при df≥30); единица анализа —
задача. Чистый python, без numpy/scipy, покрыт тестами.
Изменено
- Разбор отказов («где ломается код») поднят сразу под детальные лидерборды, перед
профилем по навыкам. Заголовок столбца «решено» → «решено целиком» (отличие от средней
M̄ с частичным зачётом). Страница «Лидерборд» приведена к виду README.