v1.29.1 — 聚类词质量
一项修复:拥挤目录的聚类词不再把名额花在描述目录本身的词上。
Changed
-
聚类词质量(#55)。 一个词要成为拆分候选,拆出去的和留下的都得能独立成夹 —— 原来只检查了前者。现在余数也必须过
CLUSTER_MIN_NOTES。用余数而不是百分比是刻意的:不需要引入第二个魔法数字,直接复用已在用的阈值,而且随目录大小自动缩放 —— 7 篇里覆盖 6 篇和 200 篇里覆盖 172 篇都是 86%,但完全不是同一个决定。
另外两条:词等于目录名的,不看比例直接剔除 ——
20-Learning/AI-Agent/ai-agent/是给目录改名,不是拆分,而余数规则漏得掉它(那个词覆盖 25/34,留下 9 篇,够建目录)。标题里若是某个已计数标签的连字符组成部分,也不单独上榜 ——ai和agent就是ai-agent数了两遍,而原来的守卫只挡「和整个标签同名」的情况。参考 Vault 上
20-Learning/AI-Agent有 11 个达标词、只报 6 个,而那 6 个里有 4 个是噪音:目录名本身、目录名的两半、以及「文章」。两个真候选llm-engineering和vibe-coding被截断在名单之外。现在四个真候选标签全部进榜。10-Work/日报现在什么都不报,这是诚实的答案 —— 四个各覆盖 30/30 的词描述的是这个目录,不是它里面的子主题;而spring-boot(5/13)这样正当的大集群照常上报。剔除而不是排到最后:名额本身就是稀缺资源,被挤掉的正是真候选。