Skip to content

brake evaluator baseline integrity

Claude Lin & Lay edited this page Jul 27, 2026 · 3 revisions

brake 評価者のベースライン保全は権限でなく指示と材料で行う

Question

brake 1 / brake 2 の評価者が評価対象を書き換え、他の評価者のベースラインを壊す事故を、何で防ぐか。

Current resolution

subagent のツール権限は変更しない。 brake の委譲プロンプトで評価対象を書き換えないよう明示的に指示し、あわせて評価者へ渡す材料を PR の URL に寄せて共有クローンのパスを名指ししない。

前者が書き込みの意図を断ち、後者が共有ベースラインという的そのものを外す。2つは合成して使う。

評価者区分だけツール権限を絞る設計(agent 定義の tools:)は採らない。

Edges

  • depends on brake1-single-round-cap — 1巡制限下では1ラウンドの verdict がそのまま出荷判断になるため、そのラウンドのベースラインが汚れていることの代償が上がる。ラウンドを重ねる設計であれば次ラウンドで気づけた
  • depends on implementation-always-delegated — 実装が常に委譲され brake が CI green 後に走ることで、評価者へ渡す材料が push 済み SHA と緑の run URL に確定した。材料を PR の URL に寄せる余地はこの位置決定が作った
  • conflicts with (現時点で対立 entry なし)

背景

PR #1581 の brake 1 で、評価者3体へ同一のローカルクローンのパスを渡した。評価者Aが mutation test でソースを差し戻して復元する間に評価者Cが走り、Cは「テストが非決定的に落ちた」と報告した。存在しない flakiness が実欠陥候補として上がる形で現れ、親が単独実行で安定を確認して初めて切り分いた。

同軸の先行例が PR #1560 にある。親が評価プロンプトへ古い main ref の diff コマンドを書き、無関係な2ファイルが混入した diff を渡していた。3体中2体が自力で除外したため実害は出なかったが、評価者が気づかなければ検出不能という性質は同じ。

観測 cluster は brake1-evaluation-baseline-not-isolated(occurrence 2)。

判断の前に確認した反証

AI 側の推奨は当初「ツール権限で縛る」だった。評価者を tools: Read に絞れば物理的に書けなくなり、rules/model/subtractive-structural-beauty.md が求める「実行が保証される構造」に到達する。brake 2 の adapter/claude/agents/l1-gate-eval.md が既にその形で実装されている。

Master はこれを採らなかった。理由 = subagent の書き込み権限そのものを触りたくない。

この経路には副次的な重さもある。skills/evolution-parallel-agent-eval/SKILL.md Constraint が brake 1 評価者への custom-agent ファイル使用を禁じており(理由 = モデル床の固定方法と probe 型 identity の保全)、Claude Code では agent ファイル本文が system prompt を置き換えるため「ツールだけ縛って identity を触らない」ができない。probe 型の実運用実績を調べた上で型ごとに分岐する必要が生じる。ツール権限を採らない判断は、この分岐ごと降りることでもある。

受容した対価

指示は親が委譲プロンプトへ毎回書く手続きであり、忘れれば効かない。rules/model/subtractive-structural-beauty.md の procedure-vs-structure 判定では置き換え対象の側に立つ。強制する構造(hook / gate)は置かない。

緩和として、指示の literal は仕様側に置く。親が毎回文言を作文するのではなく写す形にすることで、「何を書くか」の負荷を消し「書くこと自体」の recall だけを残す。

実測

PR #1583 の brake 1 では、親が手でこの指示を書いた状態で評価者3体を走らせ、3体とも書き込みゼロだった。指示は実際に守られている(n=1)。同 PR は brake の実行位置を CI green 後へ固定した最初の適用でもあり、材料が SHA と run URL に限定されていた効果と分離できていない点に注意。

PR URL 経路はリポジトリ外のディレクトリから実測済み。gh pr diff <n> --repo <owner>/<repo> は clone 無しで差分を返し、gh api repos/<owner>/<repo>/contents/<path>?ref=<SHA> は任意 SHA の任意ファイル本文を返す。弱点はリポジトリ全体の grep で、GitHub code search は本リポジトリで総ヒット 0 が返り当てにできない。全体掃きが要る軸では評価者が自分の作業ディレクトリへ clone することになるが、共有面ではないので隔離は保たれる。

Related

  • #1584 — 本判断の実装先
  • #1582 / PR #1583 — brake の実行位置を CI green 後へ固定。材料を SHA + run URL に限定する記述はこの PR で入った
  • #1575 / PR #1581 — 汚染の観測元
  • skills/evolution-parallel-agent-eval/SKILL.md — brake 1 の手続き本体

要求仕様書 (1-6)

参考文書 (A-K)

判断構造

Clone this wiki locally