Releases: genlab-1c/prism
Release list
PRISM v1.8.0 — расширение счетчика линейной стоимости, экспорт датасета, perf_baseline
[1.8.0] — 2026-07-19
Категория A выросла с 9 до 15 задач, а ось оптимальности застрахована «двумя якорями».
В лидерборде — новые модели, на витрине — журнал изменений. Конституция и протоколы (основа
compat_hash) не менялись, прогоны остаются совместимыми; замер оси O стал точнее — теперь
учитываются Массив.Вставить/Удалить.
Добавлено
- Шесть новых задач категории A (A10–A15): вставка в отсортированный массив, рабочие дни
между датами, удаление значений, максимальная сумма подмассива, разворот слов, степень по
модулю. Банк A вырос с 9 до 15 задач. Каждая — условие, скрытые тесты, эталон, нагрузочный
профиль оси O и медленный якорь-baseline. - Гейт «двух якорей» для оси O. У каждой A-задачи, кроме эталона, есть нарочно медленное,
но корректное решение;prism checkтребует, чтобы оценка O видела разницу между ними
(эталон O≥8, baseline O≤4) — доказательство, что уcost_modelнет слепой зоны. - Новые модели в лидерборде, прогнаны и оценены на обеих категориях: Claude Sonnet 5,
GPT-5.6 Terra, GPT-5.6 Sol, MiMo-V2.5 Pro, GLM-5.2, Kimi K2.7 Code, Kimi K3. - Экспорт датасета PRISM-SMOP в JSONL для Hugging Face (
genlab-1c/prism-smop). - Даты релиза моделей в каталоге (
generation/models.yaml). - Журнал изменений на витрине — курируемая лента «что нового» под лидербордом и модалка
со всеми записями (источникdocs/changelog.md); ссылки на датасет Hugging Face. - Навигация «предыдущая/следующая модель» по рангу прямо в карточке модели.
Изменено
- Инструментовка стоимости O расширена —
Массив.Вставить/Удалитьтеперь учитываются в
замере (аналогиПризмаВставить/Удалить): линейная стоимость этих операций видна оси O. - Пять моделей переведены на канал AITUNNEL (
openai_compat) — стабильнее прокси; канал
доступа на баллы не влияет.
Исправлено
- Агрегация статистики по имени модели, а не по внутреннему id: переезд модели между
каналами больше не разбивает её на две неполные строки лидерборда. - Мобильная вёрстка: шапка сайта не прыгает при переходах (раскладка ушла на CSS вместо
JS), широкие таблицы в документации прокручиваются, а не ломают страницу; витрина адаптивна. - Достоверность документации — сплошная сверка с кодом и данными: убраны устаревшие
вердикты о моделях, несуществующие примеры команд (--models claude) и битая ссылка на
YAxUnit; описание оси O приведено в соответствие с кодом (замер исполнением там, где есть
perf.yaml, статика — как откат); вvalidity.mdдописано обоснование вывода статической
оси P (ρ = −0.27) и методика взвешенной каппы, на которые ссылались метрика и скореры. - Битый бейдж датасета Hugging Face в README.
PRISM v1.7.0 — динамическое исполнение оси оптимальности, нагрузочные тесты
[1.7.0] — 2026-07-12
Ось оптимальности O стала исполняемой: вместо статического анализа кода — замер под
нагрузкой на растущих входах. Определение оси O переопределено — отсюда минорный релиз.
Добавлено
- Исполнительная ось O. Категория A — рост числа операций на растущем входе (codestat
OneScript); категория B — рост числа обращений к СУБД на растущей базе (техжурнал 1С, где
у задачи естьperf.yaml). Класс роста сравнивается с оптимальным. - Нагрузочная задача B5 (конвертация валют) с профилем роста базы.
- Экономическая ось витрины — цена, скорость и число токенов на одну генерацию,
парето-оптимум «качество ↔ затраты». - Вкладка «Нагрузка» в разборе генерации — график роста «стоимости» с пояснением, откуда
берутся числа и что значит класс роста. - Логотипы вендоров в графиках лидерборда и экспортных таблицах (PNG/SVG).
- SEO — карта сайта, OG-превью при шеринге, мета-теги.
Изменено
- Гейт корректности O. У нерешённой задачи (M ниже порога) оптимальность не оценивается
(O = N/A): слабые модели больше не показывают «O=10» на нерабочем коде. - Авто-Экспорт точки входа. Харнесс сам дописывает «Экспорт» кандидату — это деталь
вызова из модуля тестов, а не часть задачи. Оживило кандидатов, падавших на «Метод объекта
не обнаружен» (средний M по категории B заметно вырос). - Витрина — по-человечески. Карточка модели с плюсами и минусами; ошибки компиляции и
тестов переведены на понятный язык (видно, упал код модели или сам тест); номера строк в
коде; дерево объектов синтетической базы; класс роста как формула (N¹, N²). - Везде «учебная база» → «синтетическая база».
Исправлено
- Дата прогона в бейдже shields.io ломалась на дефисах (ГГГГ-ММ-ДД).
PRISM v1.6.1 — консистентность экономики моделей в витрине
[1.6.1] — 2026-07-08
Экономика в витрине — точнее и понятнее: цены сведены к единой базе (прайс-лист
провайдера), а стоимость показывается за одну генерацию. Метрика и набор задач не
менялись — это патч.
Исправлено
- Цены — единый прайс-лист провайдера. Часть моделей считалась по рублёвой рознице
реселлера AITUNNEL (наценка ×2.35, наgpt-oss~×10), часть — по прайсу OpenRouter.
Свели всё к прайс-листу провайдера: зарубежные — API OpenRouter, Sber — дев-документация,
Yandex — фактический счёт (sync-режим, ÷85). Оценочных цен не осталось; канал доступа
(AITUNNEL/OpenRouter) на цену не влияет. На баллы SMOP не влияет — цена операционная. - Витрина: «цена одной генерации» вместо «стоимости прогона». Показываем среднюю
стоимость одного ответа модели (полный прогон ÷ число задач) — понятную обычному
пользователю; слово «прогон» убрано из интерфейса. Мелкие суммы — с копейками.
Добавлено
- Гейт цен в
prism check. Сборка падает, если у модели каталога нет тарифа или есть
цена-сирота (ключ без модели) — защита от рассинхронаpricing.yaml ↔ models.yaml. - Бренд-иконки вендоров OpenAI, xAI (Grok), Zhipu (GLM), MiniMax, Sber (GigaChat) —
раньше откатывались на монограмму-инициалы.
PRISM v1.6.0 — расширение билдера синтетической базы
[1.6.0] — 2026-07-07
Бухгалтерский домен в категории B: пять новых задач B16–20 и оценка на них всех 25 моделей.
Метрика и конституция не менялись — банк задач вырос (B15 → B20), а compat_hash считается
из версий конституции/протокола, не из числа задач; per-task оценки из 1.5.x сравнимы.
Добавлено
- Пять платформенных задач по бухгалтерии (
tasks/category_b/B16–B20): договор,
действующий на дату; долг контрагента по договорам; выделение НДС из константы; оборот
и сальдо по счёту в разрезе субконто. Каждая — условие + скрытые тесты + эталон
(проходитprism checkна 100%). - Синтбилдер под бух-объекты (
harness/synthconfig): ПланСчетов, РегистрБухгалтерии
(корреспонденция + субконто), ПланВидовХарактеристик, константы — синтетическая база
1С:Бухгалтерии собирается из спеки задачи. - Прогон и оценка B16–20 по всем 25 моделям (эксперимент B — 500 пар). Лидерборд
бухгалтерии: GPT-5.5 решает 4/5, Grok 4.3 и Opus 4.8 — по 4/5; топ-7 берут 2–4 из 5,
нижняя половина — 0/5. - Команда
prism score --task— частичный скоринг по указанным задачам с дозаписью
вauto_l1(прочие группы не пересчитываются), как--models. Догоняет новые задачи
без прогона всего банка по всем моделям.
Исправлено
- Бейдж «тест-кейсов» считал объявления
Процедура/Функциявtests.bslвместо
реального числа проверок (у кат. B все проверки — в однойПрогнатьТест(), а хелперы
сбивали счёт). Теперь берётся заявленныйВсего = N(TOTAL): 87 → 108, чинит счёт и
для прежних B-задач. prism score --outвне репозитория ронял финальную печать пути (relative_to) —
обёрнуто с фолбэком на абсолютный путь.
Изменено
- Модель
sonnetпереведена с OpenRouter на AITUNNEL (claude-sonnet-4.6) — канал
доступа, на баллы не влияет.
PRISM v1.5.0 — инструментарий визуализации
[1.5.0] — 2026-07-04
Инструментарий визуализации: команда prism charts в харнессе, интерактивные графики
лидерборда и выгрузка таблиц/графиков картинкой на сайте.
Метрика и банк задач не менялись — оценки из 1.4.x сравнимы напрямую.
Добавлено
- Команда
prism charts(харнесс,harness/report/charts.py) — офлайн-графики
лидерборда (matplotlib): рейтинг Q, профиль по осям SMOP; со штампом версии бенчмарка
и даты прогона. - Интерактивные графики лидерборда на сайте: радар SMOP, рейтинг по Q, профиль по
осям SMOP. Полотно следует теме сайта, выбор охвата моделей (Топ-10 / Все / выбрать
конкретные), выгрузка текущего вида в SVG или PNG. - Выгрузка таблиц картинкой (Сводка и Баллы категорий A/B) для публикаций — фирменный
SVG с вотермаркой; один тумблер Топ-10 / Все управляет и видимой таблицей, и картинкой. - Звёзды GitHub в шапке сайта обновляются в near-realtime (клиентский запрос к API,
не на этапе сборки).
Исправлено
- Дата прогона на бейджах и на сайте берётся из времени последней генерации, а не из
имени файла с результатами.
PRISM v1.4.0 — витрина бенчмарка
[1.4.0] — 2026-06-30
Модель MiMo-V2.5 и публичная витрина (сайт с лидербордом).
Метрика и банк задач не менялись — оценки из 1.3.x сравнимы напрямую
(compat_hash считается из версий конституции и протокола, не из номера пакета).
Добавлено
- Модель MiMo-V2.5 (Xiaomi) в каталоге — канал AITUNNEL (
openai_compat,
idmimo-v2.5); цена вgeneration/pricing.yaml. Прогон A+B, оценка L1. - Публичная витрина (
web/): карточка-вердикт модели с авто-нарративом и
логотипами вендоров, отдельные страницы/m/<model>с OG-превью и шерингом
(в пост зашиты версия бенчмарка и авторство), вкладка «Экономика»
(рейтинг цена/качество + карта Парето), страница задач из данных (условия,
скрытые тесты, параметры генерации, системные промпты), цены в рублях,
звёзды GitHub и быстрый старт в шапке.
Исправлено
- Методология под SEO —
descriptionтеперь попадает в<head>; устранена
утечка исходного YAML-фронтматтера в тело страницы. - Сборка витрины — каталоги данных обновляются на месте (без сноса),
это убирает 404 на свежие файлы при работающем dev-сервере.
PRISM v1.3.1 — шлюз AITUNNEL и запас токенов под reasoning.
[1.3.1] — 2026-06-27
Зарубежные модели через шлюз AITUNNEL и запас токенов под reasoning.
Метрика и банк задач не менялись — оценки из 1.3.0 сравнимы напрямую.
Добавлено
- Модели через AITUNNEL (OpenAI-совместимый шлюз, канал
openai_compat,
endpoint вgeneration/models.yaml, ключOPENAI_COMPAT_API_KEY): OpenAI
GPT-5.5, GPT-5 Mini, GPT-OSS 120B; Google Gemini 3.1 Pro и Gemini 3.5 Flash.
Цены — вgeneration/pricing.yaml(рублёвый тариф aitunnel ÷ ~85 ₽/$).
Исправлено
- Обрезка reasoning-моделей — дефолт
generation/params.yaml → max_tokens
поднят с 4096 до 16384. У reasoning-моделей рассуждение расходует выходной
бюджет, и на 4096 код обрывался (пустой или неполный ответ). Не-reasoning
модели не затронуты — они заканчивают ответ раньше потолка. - Сортировка сводного лидерборда — первая (сводная) таблица ранжировалась
по доле решённых только категории A, из-за чего сильные в алгоритмике, но
беспомощные на платформе 1С модели висели вверху. Теперь сортировка — по
среднему A и B («кто лучше в целом»); ячейки A/B остаются раздельными.
PRISM v1.3.0 — поддержка моделей GigaChat (Сбер), rebuild команда
[1.3.0] — 2026-06-26
Подключение моделей Сбера GigaChat и инструмент пересборки рулона прогона.
Метрика и банк задач не менялись — оценки из 1.2.0 сравнимы напрямую.
Добавлено
- Поддержка GigaChat (Сбер) — модели GigaChat 2 Max/Pro/Lite в каталоге
(generation/models.yaml); канал доступа — адаптерgigachat(OAuth-токен +
OpenAI-совместимый чат), ключGIGACHAT_AUTH_KEYв окружении. - Команда
prism rebuild— пересобираетexperiment_*.jsonиз чекпойнтов
.parts/(без сети). Нужна после дозапуска моделей через--resume: рулон
хранит только пары последнего--models, а.parts— полный набор; команда
приводит рулон к полному составу с диска (источник правды —.parts).
Исправлено
- Адаптер GigaChat — российский корневой сертификат: боевой транспорт ходит
без проверки CA (verify=False), иначе TLS-ошибка маскировалась под
недоступность канала. GigaChat остаётся на RU-прокси, как Yandex.
PRISM v1.2.0 — сводный лидерборд A/B, перенос модуля статистики
[1.2.0] — 2026-06-26
Подача лидерборда: сводка для беглого взгляда, мера неопределённости и цветовой профиль.
Метрика и банк задач не менялись — оценки из 1.1.0 сравнимы напрямую.
Добавлено
- Сводный лидерборд A/B — для каждой модели доля заданий, решённых целиком (код
прошёл все скрытые проверки), отдельно по алгоритмике (A) и платформе (B), с рангом и
цветовой полосой (🟩 решено целиком · 🟥 нет). Категории не усредняются — это разные навыки.
В README и на странице «Лидерборд». - Колонка «± погрешность» в детальных таблицах S·M·O·(P)·Q — полуширина 95%
доверительного интервала Q по задачам. Простым языком: больше → модель нестабильна,
меньше → ровная; пока задач мало, погрешность велика и близкие модели наравне. Точный
интервал и термин «ДИ» — дляleaderboard --fullи методики. - Профиль по навыкам — теплокарта: цвет по уровню балла (🟩 ≥7 · 🟨 4–7 · 🟥 <4) плюс
число, вместо голой матрицы. Видно с первого взгляда, с чем модель сильна, с чем слаба. - Модуль сводной статистики
harness/stats/summary— среднее, медиана, σ и 95% ДИ
(t-распределение для малых выборок, нормальное приближение при df≥30); единица анализа —
задача. Чистый python, без numpy/scipy, покрыт тестами.
Изменено
- Разбор отказов («где ломается код») поднят сразу под детальные лидерборды, перед
профилем по навыкам. Заголовок столбца «решено» → «решено целиком» (отличие от средней
M̄ с частичным зачётом). Страница «Лидерборд» приведена к виду README.
PRISM v1.1.0 — новая секция лидерборда
[1.1.0] — 2026-06-25
Добавлено
- Разбор отказов на лидерборде («где ломается код у каждой модели»): все попытки модели
раскладываются на четыре исхода — решено · неверный ответ · ошибка выполнения · не
компилируется (в сумме 100%) — с указанием самой частой поломки. Балл говорит «насколько
хорошо», разбор — на каком шаге ломается. - Атрибуция к корню, без двойного счёта. Исход засчитывается там, где прогон впервые
сломался: не скомпилировался → одна причина, а не каскад нулей по M/P/O. - Словарь типов ошибок
metrics/error_taxonomy.yaml(данные, не код): сырое сообщение
1С/OneScript → человеческая причина (напр. «нет такого поля или объекта», «перепутаны типы
данных»). Видимая корзина для неклассифицированного — словарь пополняется, а не молчит. - Вывод в CLI (
prism leaderboard --full): цветная полоса исходов символами█▓▒░—
читается и без цвета. Вывод в README и на странице «Лидерборд»: цветные квадраты,
авто-сборкаprism docs(источник — оценки L1, руками не правится).