Skip to content

test: [P2][resolver] Hand-labeled edge corpus + measured precision/recall baseline #72

Description

@codeakki

Problem

We claim ~25–35% in-repo edge resolution but have never measured precision/recall on a labeled set. We can't improve (or defend) what we haven't measured, and any resolver refactor needs a regression baseline.

Proposal

  • Hand-label call edges on 3 repos: GraphPilot itself, one mid-size OSS app, one monorepo package.
  • Record precision and recall of the current name-based resolver against the labels.
  • Commit corpus + scoring script under bench/resolver/ so it doubles as a regression suite.

Acceptance

  • bench/resolver/ corpus + script committed
  • Measured baseline precision/recall published in bench/resolver/README.md (replaces the estimated 25–35% figure in docs/limitations.md)

Metadata

Metadata

Assignees

No one assigned

    Labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions