实验分享:scope 与蒸馏的两份体检——strictScope 考卷 + 压缩悬崖保真 #339
modusensus
started this conversation in
Ideas
Replies: 0 comments
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
#280 三问闭环之后,实验线又跑了两场,各对应一条产品线的「体检」:E7 strictScope 考卷(scope 隔离,0.8.x 线)和 E8 压缩悬崖保真(蒸馏链,#24 线)。一场是机制确认加一个意外收获,一场是警告贴。全部 Kaggle T4 × qwen3:8b、温度 0、会话内配对/机械溯源口径,数据与脚本在 persistbench-sycophancy(v5 tag 已含全部内容)。
E7|strictScope 考卷:硬墙精确,软档在注入通道不存在
MUMBench(AIM, arXiv 2609.12320)带来的可检验问题:我们的 strictScope 可见性判定,等价于论文说的「索引级访问控制」吗?
造池:100 个合成多用户样本——用户 X 的任务请求 + X 自己的约束 + 用户 Y 的同话题私有记忆(带唯一 marker 值:Y 的过敏原是花生而 X 的是乳糖这类)+ 干扰项。Y 与 X 的条目同 importance 档——对泄露风险最有利的假设。三臂 n=80:
三个读数:
E8|压缩悬崖保真:静默失守有一个机器形态
Compaction Cliff(arXiv 2608.22752)的管线等价物审计:Claude Code 的 /compact 一轮后安全规则剩 53%、五轮剩 10%。我们的有损链是:蒸馏(LLM)→ dream 巩固(LLM)→ sleep 降级(120 字符规则截断)→ 再蒸馏。
40 个合成会话(5 场景 × 8 marker 变体——温度 0 下同文重复 ≈ 同一测量,变体化是独立性的前提),每会话 4 条带唯一 marker 的约束嵌在对话里。走真代码路径:STR.prompts.summary 原文、parseSummaryJson 真解析、saveWithDedupe 真写入(quality filter 开)、dream 决策真校验真应用、120 字符截断逐字复刻。
四个读数:
产品建议
数据与复现
全部数据、harness、分析脚本与已执行的报告 notebook 在 persistbench-sycophancy;完整口径与局限(单模型、温度 0、合成池、宿主路由未覆盖、Y 同 importance 档是有利的放大设计)见仓库 RESULTS.md 的 E7/E8 节。下一步想把这两条各落成一个产品化计划(软档处置;解析修复 + 巩固 merge-resistant),欢迎拍砖。
All reactions