v0.4.0 — 配置化 taxonomy + 增量 checkpoint + 输入层分类目录 + onboarding
基于 Karpathy 知识库理念的四层知识蒸馏系统。本版(相对 v0.3.5)是一次重构 + 能力增强,四大主题:
✨ 新能力
配置化 taxonomy
- 分类维度 / 类型简写 / 标签规则 / 主题 / 桥接规则全部外置到
scripts/taxonomy.default.json - 用户可在
<vault>/taxonomy.json覆盖:默认深合并,顶层_replace:[段名]做整段替换(彻底重定义分类、不残留默认旧类) clipping_refiner/link_suggester读配置驱动
增量 checkpoint
daily_distill/weekly_review默认只处理自上次运行以来新增/变化的文档- mtime 快筛 + 内容 hash 兜底(对抗云盘刷新 mtime 的误判);漏跑自动补扫、连跑不重叠
--days/--since手动时间窗覆盖(不读写 checkpoint),--reset-checkpoint清状态- 状态存
<vault>/.kis_state.json,日/周各自独立 key
输入层分类目录
- 每日蒸馏时对输入内容多标签分类(复用 taxonomy 的 contentTypes key)
- 关键词后端(默认离线)+ LLM 后端(opt-in、降级安全、只提议不改 taxonomy)
catalog.json数据源 → 渲染输入层分类目录.md(按分类看 / 按文档看双视图)classify.minKeywordHits多标签精准阈值;零命中归「其他」+ 待审队列(不阻塞)--classify=keyword|llm|off控制
Taxonomy onboarding
kis_onboard.py(--status/--template/--validate/--write)非阻塞引导用户声明自己领域的分类- 不声明也能用通用默认
🐛 修复
link_suggesterPYTHONHASHSEED 导致的非确定性- ideas 根路径改为递归扫全树(daily / weekly / idea_tracker 口径一致)
📄 说明
个人 taxonomy.json 与运行时状态文件(.kis_state.json / catalog.json / 待审队列 / 分类目录)均不进仓库(gitignore)。全部能力无网/无 API 也能跑,LLM 一律 opt-in、默认关闭。