Skip to content

dsh-vision v0.3.0

Latest

Choose a tag to compare

@xzyonline xzyonline released this 15 Aug 15:57
· 1 commit to main since this release

v0.3.0 — dsh-parse document layer + vision skill in-repo

视觉方案第五层落地:本地文档 → Markdown 结构化解析。自 v0.2.0 以来 2 个 commit。

✨ New

  • dsh-parse 文档解析层 — 基于 Microsoft markitdown(装在本机 vision venv,与 DSH profile 完全隔离),把 PDF / Word / PPT / Excel 等保结构转为 Markdown(标题/列表/表格),本地运行、免费、不联网。薄 wrapper scripts/dsh-parse.sh 随附,实测 ~0.4s。

    • 分工铁律:只提文字 → dsh-ocr(~0.5s 更快更准);整篇文档/要保结构 → dsh-parse;两者不够 → VLM。
    • 实测验证:DOCX/PDF/XLSX/PPTX 四格式全通;图片型 PDF(扫描件)正确输出空并回退 dsh-ocr——分工边界真实成立。
    • 详见 docs/dsh-parse.md
  • vision skill 入仓 — 五层使用手册(view_image / modlens_read_image / dsh-ocr / dsh-parse / vision.py + 贴图链路 + 实测基准 + 踩坑记录)随仓库发布:docs/vision-skill.md。本机 ~/.dsh/skills/vision/SKILL.md 与此文件同步维护。

📦 Distribution

  • 包版本统一为 0.3.0(修复此前 package 声明 0.1.0 与 release v0.2.0 不一致的问题)。
  • 安装方式不变:预构建包 / install.command / 源码 scripts/install.mjs

Full changelog: v0.2.0...v0.3.0