Skip to content

Releases: genlab-1c/prism

PRISM v1.8.0 — расширение счетчика линейной стоимости, экспорт датасета, perf_baseline

Choose a tag to compare

@4dand 4dand released this 19 Jul 18:41

[1.8.0] — 2026-07-19

Категория A выросла с 9 до 15 задач, а ось оптимальности застрахована «двумя якорями».
В лидерборде — новые модели, на витрине — журнал изменений. Конституция и протоколы (основа
compat_hash) не менялись, прогоны остаются совместимыми; замер оси O стал точнее — теперь
учитываются Массив.Вставить/Удалить.

Добавлено

  • Шесть новых задач категории A (A10–A15): вставка в отсортированный массив, рабочие дни
    между датами, удаление значений, максимальная сумма подмассива, разворот слов, степень по
    модулю. Банк A вырос с 9 до 15 задач. Каждая — условие, скрытые тесты, эталон, нагрузочный
    профиль оси O и медленный якорь-baseline.
  • Гейт «двух якорей» для оси O. У каждой A-задачи, кроме эталона, есть нарочно медленное,
    но корректное решение; prism check требует, чтобы оценка O видела разницу между ними
    (эталон O≥8, baseline O≤4) — доказательство, что у cost_model нет слепой зоны.
  • Новые модели в лидерборде, прогнаны и оценены на обеих категориях: Claude Sonnet 5,
    GPT-5.6 Terra, GPT-5.6 Sol, MiMo-V2.5 Pro, GLM-5.2, Kimi K2.7 Code, Kimi K3.
  • Экспорт датасета PRISM-SMOP в JSONL для Hugging Face (genlab-1c/prism-smop).
  • Даты релиза моделей в каталоге (generation/models.yaml).
  • Журнал изменений на витрине — курируемая лента «что нового» под лидербордом и модалка
    со всеми записями (источник docs/changelog.md); ссылки на датасет Hugging Face.
  • Навигация «предыдущая/следующая модель» по рангу прямо в карточке модели.

Изменено

  • Инструментовка стоимости O расширенаМассив.Вставить/Удалить теперь учитываются в
    замере (аналоги ПризмаВставить/Удалить): линейная стоимость этих операций видна оси O.
  • Пять моделей переведены на канал AITUNNEL (openai_compat) — стабильнее прокси; канал
    доступа на баллы не влияет.

Исправлено

  • Агрегация статистики по имени модели, а не по внутреннему id: переезд модели между
    каналами больше не разбивает её на две неполные строки лидерборда.
  • Мобильная вёрстка: шапка сайта не прыгает при переходах (раскладка ушла на CSS вместо
    JS), широкие таблицы в документации прокручиваются, а не ломают страницу; витрина адаптивна.
  • Достоверность документации — сплошная сверка с кодом и данными: убраны устаревшие
    вердикты о моделях, несуществующие примеры команд (--models claude) и битая ссылка на
    YAxUnit; описание оси O приведено в соответствие с кодом (замер исполнением там, где есть
    perf.yaml, статика — как откат); в validity.md дописано обоснование вывода статической
    оси P (ρ = −0.27) и методика взвешенной каппы, на которые ссылались метрика и скореры.
  • Битый бейдж датасета Hugging Face в README.

PRISM v1.7.0 — динамическое исполнение оси оптимальности, нагрузочные тесты

Choose a tag to compare

@4dand 4dand released this 12 Jul 07:15

[1.7.0] — 2026-07-12

Ось оптимальности O стала исполняемой: вместо статического анализа кода — замер под
нагрузкой на растущих входах. Определение оси O переопределено — отсюда минорный релиз.

Добавлено

  • Исполнительная ось O. Категория A — рост числа операций на растущем входе (codestat
    OneScript); категория B — рост числа обращений к СУБД на растущей базе (техжурнал 1С, где
    у задачи есть perf.yaml). Класс роста сравнивается с оптимальным.
  • Нагрузочная задача B5 (конвертация валют) с профилем роста базы.
  • Экономическая ось витрины — цена, скорость и число токенов на одну генерацию,
    парето-оптимум «качество ↔ затраты».
  • Вкладка «Нагрузка» в разборе генерации — график роста «стоимости» с пояснением, откуда
    берутся числа и что значит класс роста.
  • Логотипы вендоров в графиках лидерборда и экспортных таблицах (PNG/SVG).
  • SEO — карта сайта, OG-превью при шеринге, мета-теги.

Изменено

  • Гейт корректности O. У нерешённой задачи (M ниже порога) оптимальность не оценивается
    (O = N/A): слабые модели больше не показывают «O=10» на нерабочем коде.
  • Авто-Экспорт точки входа. Харнесс сам дописывает «Экспорт» кандидату — это деталь
    вызова из модуля тестов, а не часть задачи. Оживило кандидатов, падавших на «Метод объекта
    не обнаружен» (средний M по категории B заметно вырос).
  • Витрина — по-человечески. Карточка модели с плюсами и минусами; ошибки компиляции и
    тестов переведены на понятный язык (видно, упал код модели или сам тест); номера строк в
    коде; дерево объектов синтетической базы; класс роста как формула (N¹, N²).
  • Везде «учебная база» → «синтетическая база».

Исправлено

  • Дата прогона в бейдже shields.io ломалась на дефисах (ГГГГ-ММ-ДД).

PRISM v1.6.1 — консистентность экономики моделей в витрине

Choose a tag to compare

@4dand 4dand released this 08 Jul 15:29

[1.6.1] — 2026-07-08

Экономика в витрине — точнее и понятнее: цены сведены к единой базе (прайс-лист
провайдера), а стоимость показывается за одну генерацию. Метрика и набор задач не
менялись — это патч.

Исправлено

  • Цены — единый прайс-лист провайдера. Часть моделей считалась по рублёвой рознице
    реселлера AITUNNEL (наценка ×2.35, на gpt-oss ~×10), часть — по прайсу OpenRouter.
    Свели всё к прайс-листу провайдера: зарубежные — API OpenRouter, Sber — дев-документация,
    Yandex — фактический счёт (sync-режим, ÷85). Оценочных цен не осталось; канал доступа
    (AITUNNEL/OpenRouter) на цену не влияет. На баллы SMOP не влияет — цена операционная.
  • Витрина: «цена одной генерации» вместо «стоимости прогона». Показываем среднюю
    стоимость одного ответа модели (полный прогон ÷ число задач) — понятную обычному
    пользователю; слово «прогон» убрано из интерфейса. Мелкие суммы — с копейками.

Добавлено

  • Гейт цен в prism check. Сборка падает, если у модели каталога нет тарифа или есть
    цена-сирота (ключ без модели) — защита от рассинхрона pricing.yaml ↔ models.yaml.
  • Бренд-иконки вендоров OpenAI, xAI (Grok), Zhipu (GLM), MiniMax, Sber (GigaChat) —
    раньше откатывались на монограмму-инициалы.

PRISM v1.6.0 — расширение билдера синтетической базы

Choose a tag to compare

@4dand 4dand released this 07 Jul 18:36

[1.6.0] — 2026-07-07

Бухгалтерский домен в категории B: пять новых задач B16–20 и оценка на них всех 25 моделей.
Метрика и конституция не менялись — банк задач вырос (B15 → B20), а compat_hash считается
из версий конституции/протокола, не из числа задач; per-task оценки из 1.5.x сравнимы.

Добавлено

  • Пять платформенных задач по бухгалтерии (tasks/category_b/B16–B20): договор,
    действующий на дату; долг контрагента по договорам; выделение НДС из константы; оборот
    и сальдо по счёту в разрезе субконто. Каждая — условие + скрытые тесты + эталон
    (проходит prism check на 100%).
  • Синтбилдер под бух-объекты (harness/synthconfig): ПланСчетов, РегистрБухгалтерии
    (корреспонденция + субконто), ПланВидовХарактеристик, константы — синтетическая база
    1С:Бухгалтерии собирается из спеки задачи.
  • Прогон и оценка B16–20 по всем 25 моделям (эксперимент B — 500 пар). Лидерборд
    бухгалтерии: GPT-5.5 решает 4/5, Grok 4.3 и Opus 4.8 — по 4/5; топ-7 берут 2–4 из 5,
    нижняя половина — 0/5.
  • Команда prism score --task — частичный скоринг по указанным задачам с дозаписью
    в auto_l1 (прочие группы не пересчитываются), как --models. Догоняет новые задачи
    без прогона всего банка по всем моделям.

Исправлено

  • Бейдж «тест-кейсов» считал объявления Процедура/Функция в tests.bsl вместо
    реального числа проверок (у кат. B все проверки — в одной ПрогнатьТест(), а хелперы
    сбивали счёт). Теперь берётся заявленный Всего = N (TOTAL): 87 → 108, чинит счёт и
    для прежних B-задач.
  • prism score --out вне репозитория ронял финальную печать пути (relative_to) —
    обёрнуто с фолбэком на абсолютный путь.

Изменено

  • Модель sonnet переведена с OpenRouter на AITUNNEL (claude-sonnet-4.6) — канал
    доступа, на баллы не влияет.

PRISM v1.5.0 — инструментарий визуализации

Choose a tag to compare

@4dand 4dand released this 04 Jul 02:04

[1.5.0] — 2026-07-04

Инструментарий визуализации: команда prism charts в харнессе, интерактивные графики
лидерборда и выгрузка таблиц/графиков картинкой на сайте.
Метрика и банк задач не менялись — оценки из 1.4.x сравнимы напрямую.

Добавлено

  • Команда prism charts (харнесс, harness/report/charts.py) — офлайн-графики
    лидерборда (matplotlib): рейтинг Q, профиль по осям SMOP; со штампом версии бенчмарка
    и даты прогона.
  • Интерактивные графики лидерборда на сайте: радар SMOP, рейтинг по Q, профиль по
    осям SMOP. Полотно следует теме сайта, выбор охвата моделей (Топ-10 / Все / выбрать
    конкретные), выгрузка текущего вида в SVG или PNG.
  • Выгрузка таблиц картинкой (Сводка и Баллы категорий A/B) для публикаций — фирменный
    SVG с вотермаркой; один тумблер Топ-10 / Все управляет и видимой таблицей, и картинкой.
  • Звёзды GitHub в шапке сайта обновляются в near-realtime (клиентский запрос к API,
    не на этапе сборки).

Исправлено

  • Дата прогона на бейджах и на сайте берётся из времени последней генерации, а не из
    имени файла с результатами.

PRISM v1.4.0 — витрина бенчмарка

Choose a tag to compare

@4dand 4dand released this 30 Jun 10:38

[1.4.0] — 2026-06-30

Модель MiMo-V2.5 и публичная витрина (сайт с лидербордом).
Метрика и банк задач не менялись — оценки из 1.3.x сравнимы напрямую
(compat_hash считается из версий конституции и протокола, не из номера пакета).

Добавлено

  • Модель MiMo-V2.5 (Xiaomi) в каталоге — канал AITUNNEL (openai_compat,
    id mimo-v2.5); цена в generation/pricing.yaml. Прогон A+B, оценка L1.
  • Публичная витрина (web/): карточка-вердикт модели с авто-нарративом и
    логотипами вендоров, отдельные страницы /m/<model> с OG-превью и шерингом
    (в пост зашиты версия бенчмарка и авторство), вкладка «Экономика»
    (рейтинг цена/качество + карта Парето), страница задач из данных (условия,
    скрытые тесты, параметры генерации, системные промпты), цены в рублях,
    звёзды GitHub и быстрый старт в шапке.

Исправлено

  • Методология под SEOdescription теперь попадает в <head>; устранена
    утечка исходного YAML-фронтматтера в тело страницы.
  • Сборка витрины — каталоги данных обновляются на месте (без сноса),
    это убирает 404 на свежие файлы при работающем dev-сервере.

PRISM v1.3.1 — шлюз AITUNNEL и запас токенов под reasoning.

Choose a tag to compare

@4dand 4dand released this 27 Jun 18:45

[1.3.1] — 2026-06-27

Зарубежные модели через шлюз AITUNNEL и запас токенов под reasoning.
Метрика и банк задач не менялись — оценки из 1.3.0 сравнимы напрямую.

Добавлено

  • Модели через AITUNNEL (OpenAI-совместимый шлюз, канал openai_compat,
    endpoint в generation/models.yaml, ключ OPENAI_COMPAT_API_KEY): OpenAI
    GPT-5.5, GPT-5 Mini, GPT-OSS 120B; Google Gemini 3.1 Pro и Gemini 3.5 Flash.
    Цены — в generation/pricing.yaml (рублёвый тариф aitunnel ÷ ~85 ₽/$).

Исправлено

  • Обрезка reasoning-моделей — дефолт generation/params.yaml → max_tokens
    поднят с 4096 до 16384. У reasoning-моделей рассуждение расходует выходной
    бюджет, и на 4096 код обрывался (пустой или неполный ответ). Не-reasoning
    модели не затронуты — они заканчивают ответ раньше потолка.
  • Сортировка сводного лидерборда — первая (сводная) таблица ранжировалась
    по доле решённых только категории A, из-за чего сильные в алгоритмике, но
    беспомощные на платформе 1С модели висели вверху. Теперь сортировка — по
    среднему A и B («кто лучше в целом»); ячейки A/B остаются раздельными.

PRISM v1.3.0 — поддержка моделей GigaChat (Сбер), rebuild команда

Choose a tag to compare

@4dand 4dand released this 26 Jun 20:46

[1.3.0] — 2026-06-26

Подключение моделей Сбера GigaChat и инструмент пересборки рулона прогона.
Метрика и банк задач не менялись — оценки из 1.2.0 сравнимы напрямую.

Добавлено

  • Поддержка GigaChat (Сбер) — модели GigaChat 2 Max/Pro/Lite в каталоге
    (generation/models.yaml); канал доступа — адаптер gigachat (OAuth-токен +
    OpenAI-совместимый чат), ключ GIGACHAT_AUTH_KEY в окружении.
  • Команда prism rebuild — пересобирает experiment_*.json из чекпойнтов
    .parts/ (без сети). Нужна после дозапуска моделей через --resume: рулон
    хранит только пары последнего --models, а .parts — полный набор; команда
    приводит рулон к полному составу с диска (источник правды — .parts).

Исправлено

  • Адаптер GigaChat — российский корневой сертификат: боевой транспорт ходит
    без проверки CA (verify=False), иначе TLS-ошибка маскировалась под
    недоступность канала. GigaChat остаётся на RU-прокси, как Yandex.

PRISM v1.2.0 — сводный лидерборд A/B, перенос модуля статистики

Choose a tag to compare

@4dand 4dand released this 26 Jun 12:11

[1.2.0] — 2026-06-26

Подача лидерборда: сводка для беглого взгляда, мера неопределённости и цветовой профиль.
Метрика и банк задач не менялись — оценки из 1.1.0 сравнимы напрямую.

Добавлено

  • Сводный лидерборд A/B — для каждой модели доля заданий, решённых целиком (код
    прошёл все скрытые проверки), отдельно по алгоритмике (A) и платформе (B), с рангом и
    цветовой полосой (🟩 решено целиком · 🟥 нет). Категории не усредняются — это разные навыки.
    В README и на странице «Лидерборд».
  • Колонка «± погрешность» в детальных таблицах S·M·O·(P)·Q — полуширина 95%
    доверительного интервала Q по задачам. Простым языком: больше → модель нестабильна,
    меньше → ровная; пока задач мало, погрешность велика и близкие модели наравне. Точный
    интервал и термин «ДИ» — для leaderboard --full и методики.
  • Профиль по навыкам — теплокарта: цвет по уровню балла (🟩 ≥7 · 🟨 4–7 · 🟥 <4) плюс
    число, вместо голой матрицы. Видно с первого взгляда, с чем модель сильна, с чем слаба.
  • Модуль сводной статистики harness/stats/summary — среднее, медиана, σ и 95% ДИ
    (t-распределение для малых выборок, нормальное приближение при df≥30); единица анализа —
    задача. Чистый python, без numpy/scipy, покрыт тестами.

Изменено

  • Разбор отказов («где ломается код») поднят сразу под детальные лидерборды, перед
    профилем по навыкам. Заголовок столбца «решено» → «решено целиком» (отличие от средней
    M̄ с частичным зачётом). Страница «Лидерборд» приведена к виду README.

PRISM v1.1.0 — новая секция лидерборда

Choose a tag to compare

@4dand 4dand released this 24 Jun 23:25

[1.1.0] — 2026-06-25

Добавлено

  • Разбор отказов на лидерборде («где ломается код у каждой модели»): все попытки модели
    раскладываются на четыре исхода — решено · неверный ответ · ошибка выполнения · не
    компилируется
    (в сумме 100%) — с указанием самой частой поломки. Балл говорит «насколько
    хорошо», разбор — на каком шаге ломается.
  • Атрибуция к корню, без двойного счёта. Исход засчитывается там, где прогон впервые
    сломался: не скомпилировался → одна причина, а не каскад нулей по M/P/O.
  • Словарь типов ошибок metrics/error_taxonomy.yaml (данные, не код): сырое сообщение
    1С/OneScript → человеческая причина (напр. «нет такого поля или объекта», «перепутаны типы
    данных»). Видимая корзина для неклассифицированного — словарь пополняется, а не молчит.
  • Вывод в CLI (prism leaderboard --full): цветная полоса исходов символами █▓▒░
    читается и без цвета. Вывод в README и на странице «Лидерборд»: цветные квадраты,
    авто-сборка prism docs (источник — оценки L1, руками не правится).