Шесть коротких синтетических задач для сравнения моделей по способности:
- удерживать одновременно много ограничений;
- поддерживать внутреннюю модель зависимостей;
- учитывать приоритеты и исключения;
- не «чинить» отвлекающий шум;
- доводить многошаговую задачу до полностью согласованного результата.
Это не тест на знание фреймворков, алгоритмические трюки или поиск по большой кодовой базе. Все задачи используют только HTML/CSS/JavaScript и Node.js без внешних зависимостей.
- Node.js 18+
- Любой агент, которому можно дать рабочий каталог и текст
TASK.md
node scripts/init-run.js "Qwen-35B-A3B"Будет создано:
runs/Qwen-35B-A3B/
01-constraint-dashboard/
02-state-machine/
03-policy-pipeline/
04-decoy-bugfix/
05-release-graph/
06-incident-mesh/
В каждом каталоге лежит только то, что должна видеть модель: TASK.md и стартовые файлы.
Дай агенту рабочим каталогом конкретную папку, например:
runs/Qwen-35B-A3B/01-constraint-dashboard
Базовая инструкция агенту:
Прочитай TASK.md и выполни задачу полностью. Работай только в текущем каталоге, строго запрещены любые CRUD операции вне этого каталога. Любая попытка найти конектс вне данного каталога = автоматический провал данной задачи! Не задавай вопросов. Перед завершением проверь все требования и запусти доступные проверки.
Не показывай модели каталог graders/.
node scripts/grade.js "Qwen-35B-A3B" 1node scripts/grade-all.js "Qwen-35B-A3B"Итог сохраняется в:
runs/Qwen-35B-A3B/score.json
- Одинаковый agent harness.
- Одинаковый системный промпт.
- Одинаковый reasoning effort / hardness.
- Новый чистый контекст на каждую задачу.
- Не давать модели grader или результаты другой модели.
- Желательно 3 прогона на модель: итоговые задачи бинарные, поэтому один прогон шумный.
- Температура 0–0.3.
- Ограничение времени: примерно 10–15 минут на задачу.
Каждая задача имеет:
- hard pass — все критические инварианты соблюдены;
- partial score — доля проверок;
- разбиение по категориям:
- correctness;
- constraint retention;
- dependency consistency;
- scope discipline;
- self-verification.
Главная метрика для сравнения — число полностью пройденных задач из 6. Partial score нужен для диагностики, но не должен заменять hard pass.
- Constraint Dashboard — переплетение UI-ограничений, форматирования, состояния и запретов.
- State Machine — обновление внутренней модели после серии исключений и переходов.
- Policy Pipeline — приоритет правил, исключения, агрегация и стабильный порядок.
- Decoy Bugfix — поиск настоящей причины среди ложных следов при жёстком контроле области изменений.
- Release Graph — граф зависимостей, транзитивная блокировка, приоритет ручных исключений и согласованность отчёта.
- Incident Mesh — hard/soft deps, peer-кворумы, зональные инциденты, flaky-тесты, четыре статуса и итеративная фиксация.
- 6/6: очень сильная процедурная надёжность на коротком горизонте.
- 5/6: сильная.
- 4/6: заметные провалы удержания нити.
- 0–3/6: модель хорошо решает локальные подзадачи, но ненадёжна как автономный исполнитель.
Этот набор короткий и синтетический. Он не является заменой SkillsBench, SWE-bench или Terminal-Bench.