Skip to content

research: 写作基建 + 第十二/十三轮竞争空间证伪(声明第五次收紧) - #337

Open
oratis wants to merge 2 commits into
claude/lir-p2-three-arm-e5from
claude/lir-writing-watchlist
Open

research: 写作基建 + 第十二/十三轮竞争空间证伪(声明第五次收紧)#337
oratis wants to merge 2 commits into
claude/lir-p2-three-arm-e5from
claude/lir-writing-watchlist

Conversation

@oratis

@oratis oratis commented Aug 1, 2026

Copy link
Copy Markdown
Owner

⚠️ 堆叠 PR 链:#335#336(P2 实验)← 本 PR。合并时勿用 --delete-branch

内容

1. 第十二/十三轮:竞争空间重扫 + watchlist 证伪

  • 第十二轮(WebSearch 3 角度,摘要级):22 候选 → 5 高关注对象
  • 第十三轮(5 篇全文 / 45 票全一致):无一构成判据轴反例,核心句存活;但 GovMem 确证占据「GT-free 推理期按条写入门」环节 → 声明第五次收紧(REPORT §4 docs(CONTRIBUTING): key requirement reflects 20+ provider support #20 + 禁令 4)
  • watchlist.md:5 篇差异句 + 引用义务 + 扫描级候选 + 投稿前重扫 SOP
  • 关键新引用义务:NEMORI(最近邻 surprise 门)、InfoMem(最近量亲缘——同量、训练期 reward、需 GT)、GovMem 0/133 负结果(利我)

2. 写作基建

  • paper/references.bib:全部 bibkey(未核字段带 [TODO-verify],内嵌引用陷阱防呆注释)
  • Intro ¶4 重写 + Related Work 新增 ¶2b(推理期写入门谱系)+ 措辞红线表 +3 行

3. KNOWLEDGE doc 两项待办

  • §5.3 机器遗忘文献(🔍 标注);DEFER→evict = 写入前可逆性卖点
  • §1.2b I1–I5 五判据可测化(测量协议 + 判分)

🤖 Generated with Claude Code

oratis and others added 2 commits August 1, 2026 12:51
- paper/references.bib:全部引用的正式 bibkey;已验证字段照实,
  未核实字段(多为 2026 预印本作者名单)带 [TODO-verify] 标注;
  内嵌两个已知引用陷阱的防呆注释(GDumb 引 proceedings、Hopfield 钉 v3)
- KNOWLEDGE §5.3:补机器遗忘文献(SISA/WHP/TOFU/RMU,全部 🔍 标注
  引用前须核);点出 DEFER→evict = 写入前可逆性的设计卖点
- KNOWLEDGE §1.2b:I1-I5 五判据全部给出测量协议+判分(💭→可操作),
  材料由 P1 生成器供给;L0-L5 判级协议
- §8 两项待办勾销

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
第十二轮(3 角度 WebSearch,摘要级):22 候选,空白正被快速填补,
5 个高关注邻居转第十三轮全文验证。

第十三轮(5 篇全文 / 15 主张 / 45 票,全部一致):
- 无一构成判据轴反例 → 核心句存活:「尚无方法以压缩增益/MDL 为判据
  对推理期按条持久写入做准入门控」
- 但 GovMem(2607.02579v1)确证为 GT-free·按条·推理期写入路径的准入门
  (promote/reject/review,判据=依赖去重支持度)→ 「已有 GT-free 门均在
  训练期」作废 → 声明第五次收紧(#20)+ 新增禁令 4(不得暗示推理期
  写入门无人做);其 0/133 可安全自动 promote 反成利我证据
- NEMORI(2508.03341v4)= 最近邻 surprise 门(收「让模型惊讶」的信息,
  我方收「使留出用法编码更廉」的信息,方向近乎相反)——必须显著正面引用
- InfoMem(2606.03329v1)= 最近量亲缘:r_gain 数学上正是 held-out
  codelength 削减,但作训练期 GRPO reward(轨迹级/需 gold answer/episodic);
  其 GT-free 变体更差 → 我方以决策序列观测量回应该挑战
- DeMem/A-MAC 非反例(task-reward 族 / 五因子监督)

产物:watchlist.md(差异句+引用义务+重扫 SOP)、r12/r13 原始记录、
Intro ¶4 重写 + Related Work 新增 ¶2b、红线表 +3 行、bib +5 条、
REPORT 11→13 轮全链同步(五次收紧史/禁令 4/#20/§6)

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant