Releases: dark5un/pulse
Release list
v0.6.0: /pulse deep + honest cost + agreement numbers
Slash-command LLM judge via host ctx.llm (no keys, verdicts on card, run_mode=deep). Cost: Hermes-reported dollars or tokens-only, never estimated. Agreement gate first real-key run published (kappa=0.0/agree=1.0, n=10, FAIL pending — thin corpus, as designed). Capture-side session tags end-to-end. 194 tests green, ruff + pyright clean.
v0.5.0: deep judge + session tags
B2 LLM-judge (--deep, 4 verdict signals, agreement gate at kappa>=0.6/n>=50, pending real-key run) + C2-a capture-side session tags (UNROLL_SESSION_TAGS to SESSION_TAGS to costs --group-by tag). 189 tests green, ruff + pyright clean.
v0.4.0: scenario coverage
Implements the scenario-coverage analysis plan (all GAP-NARROW items): pulse replay, compare, skills, export, experiment, bundle/verify, incident, flake, costs, leaderboard --task/--top. 166 tests green, ruff + pyright clean. B2 judge stays research-track per the plan.
v0.3.0: Session Gym
Session gym workflows: pulse leaderboard, quality gate (pulse_gate.py + CI recipe), red-team calmness (12 prompts + calmness ranking), skill portability verdicts + CLI. Shared scorer trace_score.py; sidecars gain active_skills. All standalone — needs no Hermes install. See CHANGELOG.md.
v0.2.0 — Pulse x Unroll integration
Pulse reads unroll trace files as first-class input (--unroll mode) with three unroll-native detectors (latency, cost, skill deadweight, all thresholds provisional). Session gym: corpus curator script + weekly digest cron. See CHANGELOG.md.