dsh-free-vision v1.0.7
dsh-free-vision v1.0.7 — 一步到位:粘贴图片直接给出描述
修复你的真实痛点:之前粘贴图片后,纯文本模型还要自己“找图→认图→调 image_understand”,多出好几步大模型往返。本版改为社区最成熟的 one-step 方案(同 dsh-deepseek-vision):
- 分发时内联图片描述:对纯文本模型把 image 块替换成“已自动识别的图片描述文本”,模型同一回合直接回答,全程 0 次工具调用、1 步完成(真实 E2E:
1 turns · 1 steps)。 - 描述按图片 sha256 缓存(进程内 LRU):同一张图重复出现/追问不再调视觉 API(E2E 中第二次 TTFT 19s → 3.9s)。
- image_understand 保留给精确/细分追问(OCR 逐字转写、坐标、颜色等),仍可传
/dsh-free-vision/raw/<id>。 - 新配置:
describeAtDispatch(默认开)、describePrompt、describeCacheSize(默认 64),在 设置 → Free Vision → 高级设置。 - 实测:引擎 spawn ~333ms、base64 为毫秒级、视觉 API ~1.9s(大头在厂商 API,缓存消除重复)。
E2E 里模型 Think 原文:“They pasted a detailed image description (already auto-recognized) … I can answer directly.” → 全程未调 image_understand。