Skip to content

PRISM v1.2.0 — сводный лидерборд A/B, перенос модуля статистики

Choose a tag to compare

@4dand 4dand released this 26 Jun 12:11

[1.2.0] — 2026-06-26

Подача лидерборда: сводка для беглого взгляда, мера неопределённости и цветовой профиль.
Метрика и банк задач не менялись — оценки из 1.1.0 сравнимы напрямую.

Добавлено

  • Сводный лидерборд A/B — для каждой модели доля заданий, решённых целиком (код
    прошёл все скрытые проверки), отдельно по алгоритмике (A) и платформе (B), с рангом и
    цветовой полосой (🟩 решено целиком · 🟥 нет). Категории не усредняются — это разные навыки.
    В README и на странице «Лидерборд».
  • Колонка «± погрешность» в детальных таблицах S·M·O·(P)·Q — полуширина 95%
    доверительного интервала Q по задачам. Простым языком: больше → модель нестабильна,
    меньше → ровная; пока задач мало, погрешность велика и близкие модели наравне. Точный
    интервал и термин «ДИ» — для leaderboard --full и методики.
  • Профиль по навыкам — теплокарта: цвет по уровню балла (🟩 ≥7 · 🟨 4–7 · 🟥 <4) плюс
    число, вместо голой матрицы. Видно с первого взгляда, с чем модель сильна, с чем слаба.
  • Модуль сводной статистики harness/stats/summary — среднее, медиана, σ и 95% ДИ
    (t-распределение для малых выборок, нормальное приближение при df≥30); единица анализа —
    задача. Чистый python, без numpy/scipy, покрыт тестами.

Изменено

  • Разбор отказов («где ломается код») поднят сразу под детальные лидерборды, перед
    профилем по навыкам. Заголовок столбца «решено» → «решено целиком» (отличие от средней
    M̄ с частичным зачётом). Страница «Лидерборд» приведена к виду README.