GrayPrint 首个公开版本 —— dsh 网页端「思维链写法比对面板」。
装什么
在会话页右下角挂一块面板,把当前会话的思考文字定位在两个实测样本极点之间:
- 🟢 灰度思维链 —— 第一人称叙述(
I'm planning out…),标定自 opncd.ai 分享的 41 个 dsv4 灰度 opencode 会话 / 1749 段思考 - 🔵 当前版思维链 —— 集体人称速记(
We need answer likely…),标定自 42 个当前版standardpreset 的 DSH 会话 / 2727 段思考
只比写法,不评好坏。
怎么装(不需要任何构建授权)
dsh plugin --profile web add github:HongzhongL/dsh-grayprintlib/ 是手写的闭包工厂产物、已随仓库提交,没有 prepare 脚本,所以 pnpm 不需要你 allowBuilds 批准任何东西。也可以用本页的 tgz:
dsh plugin --profile web add ./dsh-grayprint-0.2.0.tgz装完重启 dsh web 宿主,刷新页面。
判据与验证
三条轴按实测单轴判别力加权:段落开头说 I'm/I'll(44%,单轴准确率 95.2%)、每段 I'm+I'll 次数(36%)、每段 we+let's 次数(20%)。
留出验证 92.8%(200 次 70/30 随机划分,阈值在训练折内重选)。
被剔除计分的轴:块首 We 类(53.0%≈随机,只在对 anchored-standard 时有效)、段落中位长(50.6%≈随机,且方向与最初假设相反 —— 灰度段落更短)、let me(两极仅差 5.7 倍,而它恰是 NoLetMe 的唯一判据)。
四道守卫
中文思考 >15% 拒判、思考段落 <5 拒判、判「灰度」需 ≥16 段(非对称证据门,把标定内误判从 3 个降到 0 个)、只有可见回复时报异常而不从回复文本编造轨迹。
诚实边界
- 两极样本来自不同渲染通道(灰度侧是 opencode 分享页呈现,当前侧是 DSH 原生 reasoning),部分差异可能来自通道而非模型版本,这一点尚未排除。
- 灰度侧只有正例(幸存者偏差),两侧都没有任务评分。
- preset 的影响大于版本的影响:同一当前模型换 preset,得分可从 10% 到 86%。所以一个「灰度」读数不能推断模型版本。
本面板测的是推理的叙述人称形态,不是能力、后端、路由或 checkpoint 判定。