Jev:根据指定文件变化评估任务进展——功能、效果与裁判对照 #4838
Replies: 1 comment
|
Update: the progress-review loop now closes inside LoopX, and the differential is reproducible in the repo. Draft PR #4854 has been extended on the same branch. What changed:
Committed live recording (
All six purely cosmetic sequences were flagged at round 1 and would raise the obligation at round 2; the periodic review waits for 20 durable runs. Median assessment latency 807 ms, p95 1.5 s, 1879 median input tokens. What it does not do: cosmetic churn after a real implementation landed in the same file was not flagged ( Details, boundaries and the full table: PR #4854 and |
Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
当前结论:指定文件变化采集与任务进展观察已实现,可靠纠偏尚未证明
当前实施与评审入口是 PR #4854,目标分支为
main,只包含基于实际产物的任务进展观察。PR 尚未合并。本帖已按当前范围重写:此前的多方向排序比较和“只保留非主分支”的建议不再作为当前实施结论。讨论演进保留在中文决策记录 / English,这里说明当前功能、实际效果和未完成项。
1. 具体实现了什么
drift init绑定 Goal 契约、精确文件、初始基线drift refresh包装已有核心刷新命令,读取前后限定文件及 deltadrift drain在另一个进程判断“目标关系”和“证据增量”TYPESAFE_API_KEYdrift status展示判断、未知、失败和耗时完整操作、关闭与卸载见中文操作指南 / English。这次不包含 D2–D8、不修改核心选择器,也没有原生 hook 或前端/Lark 配置入口。
观察范围如何选择
初始化时用
--path指定精确文件,例如src/retry.py、tests/test_retry.py、reports/retry_probe.json。观察器读取清单中文件的前后内容及变化,另外使用 basis 中的目标、验收条件和显式证据引用,不自动扫描全仓或读取所有 Agent 上下文。最多 32 个选定文件,并有字节上限;清单外材料可能影响判断,不能假装不存在。这限制的是观察器输入,不是 Agent 的编辑权限。Agent 可以在其他文件推进工作,因此
no_delta不等于整个任务没有进展。读取测试报告也不意味着观察器执行了测试。当前实际便利是自动整理这些材料、保存可追溯判断;节省多少人工时间尚未测量。2. 当前实现重测的结果
运行基于当前实现源码
2f4783bdd:固定jev-1.13.0、标签概率阈值 0.6、默认 5 秒期限,五个小型构造场景各运行两次。输入包含前后限定源码与 delta;真实执行 Git、CLI、测试/探测及 API。标签在调用前固定,没有自动重试或本地缓存冒充调用。最关键的反例——装饰性改名——仍没有被识别为漂移。 四次响应的目标关系未知;十次均选择新增证据,说明这一批的增量判断没有区分预期反例。缺外部 helper 的“相关”也不能解释成“验收成立”。
4/10 是预设双标签的严格匹配,不是生产准确率 40%。目标相关、产物变化、验证证据增加存在口径差异;独立行为检查不一定包含在模型输入中,标签仍需独立裁定。重复一致不是正确性证明,接口可用也不等于任务受益。
计时阶段相互包含,不能相加;请求到响应头中位数约 646 ms,包括网络/服务端等待,不是纯推理时间。同步采集不是零开销,未测出 Agent 节省的时间。所有十份原 run 记录前后字节一致。
3. 工程验证与效果验证分开看
4. 为什么只做任务进展观察,以及下一步讨论什么
讨论从“规则保险丝有没有盲区”推进到“能否用独立证据更早发现问题”。其中已经修正两点:单个重复触发器漏检,不等于整个 LoopX 看不见;少量案例正确,不证明 Jev 是规则的严格超集。Jev 和独立 Agent 都可以承担额外判断,材料准备与问题定义必须和模型选择分开评价。
本次只提交可回退的任务进展观察工具,先让材料采集和结果核查有真实入口。是否收录这个可选工具,由 PR 评审决定;RFC #4749 的讨论稿收录不自动批准模型采用或干预。
接下来值得明确的是:
在这些问题有证据前,保持 off/shadow,不增加自动保险丝,不降低阈值追求更好看的命中率。
5. Jev、Codex 与 Claude 的裁判方法对照
这部分补充的是同一组十份小 diff 的判断器实验,Claude 是对原 Jev/Codex 对照的补测,不是第二组独立样例,也不是当前观察命令的效果数据。
已重新核对保存结果和脚本,完整模型标识、计时/成本口径和限制见决策记录的“裁判方法对照”。主要修正如下:
summary_supported,没有参与上述计分;不是当前实现的证据增量问题。输入也确实带了统一自报摘要和tests_pass,不能说完全排除了自述。当前观察命令采用两道 Choice,没有实现这个 Noul 规则,也没有接入 Claude/Codex 升级复核。旧规则还可能误伤没有运行时行为变化的有效测试、文档和前置工作。应在同一批当前材料和独立标签上重新比较后,再决定是否采用。
English summary: PR #4854 targets upstream main with scoped task-progress observation only. Scoped capture, independent inference, deduplication/recovery, configuration and readback are implemented. Current checks returned 10/10 API responses and preserved the original run records, but did not detect the decorative-work counterexample. Exact label agreement was 4/10, not production accuracy. The tool remains off/shadow; reliable correction and task benefit are unproven. This discussion supersedes the earlier multi-direction/non-main implementation summary.
All reactions