Skip to content

v0.2.1 — 判定可解释:告别长度阈值,行为学盲目重试检测

Choose a tag to compare

@lamost423 lamost423 released this 19 Aug 11:01
· 11 commits to main since this release

判定规则重构(诚实优先)

「结果 <60 字符 = 死路」退役了。 三个真实会话(338 次工具调用)校准发现:这条规则冤枉了 56 次调用——todo_write 的成功确认恰好 57 字符全军覆没、"patch ok" 这类短成功全被判死路,反倒漏掉 2 条带 Traceback 的真失败。长会话 242 步里约 21% 被画成假支路。

新判定(无长度阈值)

  • 单工具三层:错误标志(isError)→ 通用失败特征(Traceback / command not found / HTTP 4xx·5xx / [status=Failed] / __EXIT__)→ 按工具分类:写入类无错误即成功;检索类空结果才扑空;bash 及未知工具有输出即成功。
  • 盲目重试(新增,灰 ↻):行为学判定——连续「同工具 + 参数相似」调用簇且簇内至少一次失败,借鉴 AgentLens 对 SWE-agent 轨迹浪费的确定性检测。不加失败约束会把「连续编辑同一文件」这类正常工作冤枉进去。
  • 每个判定带依据文本:tooltip 与详情面板显示,如「同一操作连续重试 4 次(其中 1 次失败),判为盲目重试」。
  • 项目特定错误话术(No such container 等)退役,换通用特征集。

结构修复

  • 判定逻辑收敛为单一真相源 src/client/verdict.js:live-data.ts 正常 import,上传页构建期注入——两份镜像漂移问题永久消除。
  • 修复上传路径从未赋工具级判定的旧 bug(tooltip 的 ✗ 此前在上传模式永不显示)。
  • neutral 死代码删除;deadend 收窄为「检索确实空手而归」。
  • 阈值与分类全部在 VERDICT_RULES 常量,可按语料调整。

视觉后果(诚实的代价)

迷宫会比 v0.2.0 直很多——校准会话的支路从 60 步收敛到 10 步真失败。每条支路点开都能看到判定依据。

安装

dsh plugin --profile web add https://github.com/lamost423/dsh-trace-compare/releases/download/v0.2.1/dsh-trace-compare-0.2.1.tgz

🤖 Generated with Claude Code