Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

4 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Mini SkillBench: Thread & Constraint Retention

Шесть коротких синтетических задач для сравнения моделей по способности:

  • удерживать одновременно много ограничений;
  • поддерживать внутреннюю модель зависимостей;
  • учитывать приоритеты и исключения;
  • не «чинить» отвлекающий шум;
  • доводить многошаговую задачу до полностью согласованного результата.

Это не тест на знание фреймворков, алгоритмические трюки или поиск по большой кодовой базе. Все задачи используют только HTML/CSS/JavaScript и Node.js без внешних зависимостей.

Требования

  • Node.js 18+
  • Любой агент, которому можно дать рабочий каталог и текст TASK.md

Быстрый запуск

1. Создать каталоги для модели

node scripts/init-run.js "Qwen-35B-A3B"

Будет создано:

runs/Qwen-35B-A3B/
  01-constraint-dashboard/
  02-state-machine/
  03-policy-pipeline/
  04-decoy-bugfix/
  05-release-graph/
  06-incident-mesh/

В каждом каталоге лежит только то, что должна видеть модель: TASK.md и стартовые файлы.

2. Запустить агента отдельно на каждой задаче

Дай агенту рабочим каталогом конкретную папку, например:

runs/Qwen-35B-A3B/01-constraint-dashboard

Базовая инструкция агенту:

Прочитай TASK.md и выполни задачу полностью. Работай только в текущем каталоге, строго запрещены любые CRUD операции вне этого каталога. Любая попытка найти конектс вне данного каталога = автоматический провал данной задачи! Не задавай вопросов. Перед завершением проверь все требования и запусти доступные проверки.

Не показывай модели каталог graders/.

3. Оценить одну задачу

node scripts/grade.js "Qwen-35B-A3B" 1

4. Оценить все задачи

node scripts/grade-all.js "Qwen-35B-A3B"

Итог сохраняется в:

runs/Qwen-35B-A3B/score.json

Как сравнивать модели честно

  • Одинаковый agent harness.
  • Одинаковый системный промпт.
  • Одинаковый reasoning effort / hardness.
  • Новый чистый контекст на каждую задачу.
  • Не давать модели grader или результаты другой модели.
  • Желательно 3 прогона на модель: итоговые задачи бинарные, поэтому один прогон шумный.
  • Температура 0–0.3.
  • Ограничение времени: примерно 10–15 минут на задачу.

Метрики

Каждая задача имеет:

  • hard pass — все критические инварианты соблюдены;
  • partial score — доля проверок;
  • разбиение по категориям:
    • correctness;
    • constraint retention;
    • dependency consistency;
    • scope discipline;
    • self-verification.

Главная метрика для сравнения — число полностью пройденных задач из 6. Partial score нужен для диагностики, но не должен заменять hard pass.

Что измеряет каждая задача

  1. Constraint Dashboard — переплетение UI-ограничений, форматирования, состояния и запретов.
  2. State Machine — обновление внутренней модели после серии исключений и переходов.
  3. Policy Pipeline — приоритет правил, исключения, агрегация и стабильный порядок.
  4. Decoy Bugfix — поиск настоящей причины среди ложных следов при жёстком контроле области изменений.
  5. Release Graph — граф зависимостей, транзитивная блокировка, приоритет ручных исключений и согласованность отчёта.
  6. Incident Mesh — hard/soft deps, peer-кворумы, зональные инциденты, flaky-тесты, четыре статуса и итеративная фиксация.

Интерпретация

  • 6/6: очень сильная процедурная надёжность на коротком горизонте.
  • 5/6: сильная.
  • 4/6: заметные провалы удержания нити.
  • 0–3/6: модель хорошо решает локальные подзадачи, но ненадёжна как автономный исполнитель.

Этот набор короткий и синтетический. Он не является заменой SkillsBench, SWE-bench или Terminal-Bench.

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages