Skip to content

dsh-free-vision v1.0.7

Choose a tag to compare

@FuzzySoul FuzzySoul released this 18 Aug 12:49
· 2 commits to main since this release

dsh-free-vision v1.0.7 — 一步到位:粘贴图片直接给出描述

修复你的真实痛点:之前粘贴图片后,纯文本模型还要自己“找图→认图→调 image_understand”,多出好几步大模型往返。本版改为社区最成熟的 one-step 方案(同 dsh-deepseek-vision):

  • 分发时内联图片描述:对纯文本模型把 image 块替换成“已自动识别的图片描述文本”,模型同一回合直接回答,全程 0 次工具调用、1 步完成(真实 E2E:1 turns · 1 steps)。
  • 描述按图片 sha256 缓存(进程内 LRU):同一张图重复出现/追问不再调视觉 API(E2E 中第二次 TTFT 19s → 3.9s)。
  • image_understand 保留给精确/细分追问(OCR 逐字转写、坐标、颜色等),仍可传 /dsh-free-vision/raw/<id>
  • 新配置:describeAtDispatch(默认开)、describePromptdescribeCacheSize(默认 64),在 设置 → Free Vision → 高级设置。
  • 实测:引擎 spawn ~333ms、base64 为毫秒级、视觉 API ~1.9s(大头在厂商 API,缓存消除重复)。

E2E 里模型 Think 原文:“They pasted a detailed image description (already auto-recognized) … I can answer directly.” → 全程未调 image_understand。