CleanMark 是一个面向桌面 Agent 的 Markdown 深度整理 Skill。当前计划安装在 WorkBuddy 中,用于读取 WebMark 生成的 Raw Markdown,进行结构修复、分类校正、标签规范、去重和内容整理,并生成独立的 Clean Markdown。
这套 Markdown 工作流由五个相互配合、边界独立的项目组成:
- WebMark:数据采集 Skill;
- CleanMark:深度整理 Skill;
- FolderMark:无具体内容的开源发布程序;
- PublishMark:包含 Clean 内容的具体 FolderMark 项目;
- mdFlow:各环节共同遵守的内容分类、YAML 和处理规范中心。
它们与桌面 Agent 一起组成以下自动化工作流:
用户通过 WorkBuddy App / 微信 / QQ / 飞书发送 URL
↓
WorkBuddy 调用 WebMark
↓
抓取、基础清洗、分类并生成 Raw Markdown
├── 保存到本地 Raw 文件夹
├── 上传对应的乐享知识库
└── 同步到服务器 Markdown 文件夹
↓
FolderMark-Raw 即时展示原始资料
↓
WorkBuddy 调用 CleanMark
↓
深度清洗并生成独立 Clean 内容
↓
写入 PublishMark 并提交 Git
↓
Cloudflare 自动部署正式内容站点
FolderMark 是独立的通用开源项目,不依赖 mdFlow,也不读取任何外部配置中心。PublishMark 是基于 FolderMark 建立的具体站点实例,可以根据正式内容发布需要对 FolderMark 做少量适配。
CleanMark 负责工作流的第二阶段:把原始资料转化为结构稳定、分类一致、可以长期发布和维护的正式内容。
Raw Markdown
→ 深度清洗
→ 结构整理
→ 分类与标签治理
→ 去重和关联
→ 生成 Clean Markdown
→ 写入 PublishMark
→ Git 提交与正式发布
主要职责包括:
- 只读访问 WebMark 生成的 Raw Markdown;
- 修复 Markdown 标题层级、列表、引用、表格和段落结构;
- 检查抓取完整性,必要时对照原始 URL 补漏;
- 优化标题和摘要;
- 校正
collection、categories、topics和tags; - 统一同义词、历史标签和分类别名;
- 识别重复资料、近似资料和不同版本;
- 建立 Clean 文档与一个或多个 Raw 来源之间的关联;
- 生成符合 mdFlow 规范的 Clean YAML Front Matter;
- 将结果写入 PublishMark 的内容目录;
- 输出变更报告;
- 根据配置执行 Git commit 和 push。
CleanMark 永不原地修改 Raw 文件。
Raw:只读输入
Clean:独立输出
一份 Clean 文档可以来源于:
- 一份 Raw 文档;
- 同一文章的多个转载版本;
- 网页和 PDF 两种来源;
- 多篇相关资料的整理结果。
Clean 文档通过永久 ID 和 URL 记录来源,不依赖跨项目相对路径。
CleanMark 的操作分为三类:
- 安全操作:自动执行,例如格式修复、日期规范化、补充缺失字段;
- 可逆操作:执行并记录,例如移动文件、修改分类、调整 slug;
- 高风险操作:只提出建议,例如删除资料、合并正文、覆盖人工编辑内容。
CleanMark 使用 mdFlow 获取统一的分类、YAML、清洗和治理规则。
默认初始化地址:
https://my-work-flow.pages.dev/mdFlow/v1/manifest.json
CleanMark 不在日常运行时主动读取远程配置,仅在以下情况下读取:
- 首次初始化;
- 本地配置缺失或损坏;
- 用户明确指定新的 manifest 地址进行升级。
配置下载后保存在本地,并通过哈希和 Schema 校验。升级失败时继续使用上一有效版本。
CleanMark/
├── README.md
├── SKILL.md
├── scripts/
│ └── mdflow.py
├── config/
│ └── example.local.json
├── templates/
│ └── clean.md
├── tests/
└── docs/
项目处于初始设计与开发阶段。