Problem
We claim ~25–35% in-repo edge resolution but have never measured precision/recall on a labeled set. We can't improve (or defend) what we haven't measured, and any resolver refactor needs a regression baseline.
Proposal
- Hand-label call edges on 3 repos: GraphPilot itself, one mid-size OSS app, one monorepo package.
- Record precision and recall of the current name-based resolver against the labels.
- Commit corpus + scoring script under
bench/resolver/ so it doubles as a regression suite.
Acceptance
Problem
We claim ~25–35% in-repo edge resolution but have never measured precision/recall on a labeled set. We can't improve (or defend) what we haven't measured, and any resolver refactor needs a regression baseline.
Proposal
bench/resolver/so it doubles as a regression suite.Acceptance
bench/resolver/corpus + script committedbench/resolver/README.md(replaces the estimated 25–35% figure indocs/limitations.md)