Skip to content

v1.29.1 — 聚类词质量

Choose a tag to compare

@Spc-jgs Spc-jgs released this 07 Aug 06:58
· 146 commits to master since this release
6cf2f1b

一项修复:拥挤目录的聚类词不再把名额花在描述目录本身的词上。

Changed

  • 聚类词质量(#55)。 一个词要成为拆分候选,拆出去的和留下的都得能独立成夹 —— 原来只检查了前者。现在余数也必须过 CLUSTER_MIN_NOTES

    用余数而不是百分比是刻意的:不需要引入第二个魔法数字,直接复用已在用的阈值,而且随目录大小自动缩放 —— 7 篇里覆盖 6 篇和 200 篇里覆盖 172 篇都是 86%,但完全不是同一个决定。

    另外两条:词等于目录名的,不看比例直接剔除 —— 20-Learning/AI-Agent/ai-agent/ 是给目录改名,不是拆分,而余数规则漏得掉它(那个词覆盖 25/34,留下 9 篇,够建目录)。标题里若是某个已计数标签的连字符组成部分,也不单独上榜 —— aiagent 就是 ai-agent 数了两遍,而原来的守卫只挡「和整个标签同名」的情况。

    参考 Vault 上 20-Learning/AI-Agent 有 11 个达标词、只报 6 个,而那 6 个里有 4 个是噪音:目录名本身、目录名的两半、以及「文章」。两个真候选 llm-engineeringvibe-coding 被截断在名单之外。现在四个真候选标签全部进榜。

    10-Work/日报 现在什么都不报,这是诚实的答案 —— 四个各覆盖 30/30 的词描述的是这个目录,不是它里面的子主题;而 spring-boot(5/13)这样正当的大集群照常上报。剔除而不是排到最后:名额本身就是稀缺资源,被挤掉的正是真候选。