Skip to content

GateKeeper v0.4.5 — 规则缝隙封堵 + 测试回归体系 + case-library 首案

Choose a tag to compare

@tywinlu1988 tywinlu1988 released this 13 Aug 00:53
· 11 commits to master since this release

背景

深度自检 + 四轮弱模型实测(DeepSeek v4 × 频准激光)的证据审查发现三个"规则缝隙":ID 枚举缩写自评通过、数字追溯链无约束力、一手披露规定无门禁验收。同时测试体系滞后(v0.4.1+ 十余个机制无回归检查表),case-library 仍为空。

规则缝隙封堵

  • G4/S3 ID 完整枚举:ID 的 role 段必须等于完整枚举值(pre-ipo-investor / buy-side / media),禁止缩写——实测反例:第四轮全部用 RISK-pricing-pre-ipo-001 缩写却自评 G4 通过,ID 是跨节点/跨计划单追溯的主键
  • G3/S3 source_ref 必填:deep 深度下 key_data_points 逐条附 source_ref(指向 search_log 查询或 [UNLOGGED])——此前"可选"导致追溯链在 finance/pricing 使用 0 处
  • G1 一手披露验收:deep 每角色 ≥1 次招股书/问询函/发行公告查询计入门禁(此前 registry 有规定、门禁不查)
  • description 纯触发化:5 个 skill 的 frontmatter description 移除流程总结,只写触发条件与禁令——防"按 description 执行、不读正文"的捷径陷阱(writing-skills SDO 原则,弱模型下风险更高)

测试与知识库

  • 场景 7 机制回归清单:10 项 v0.4.1+ 机制检查点固化入 smoke-test-log,以四轮实测为基线
  • 搜索次数规则收敛:analysis-registry 深度表为唯一事实源,G1/Step 0 只引用不复制(延续 N10)
  • case-library 首案:频准激光发行推演——事实卡 + 四轮关键数字对照(RED/GREEN 锚)+ 失败模式清单,供 D1/D4 降级兜底与弱模型执行前参照

第五轮验证重点(建议)

场景 7 的 10 项检查点:ID 完整枚举、source_ref 覆盖率、一手披露查询、制品-日志对账、模板标记、快照带数值+URL、第四轮三个残留不复发。