Releases: xiaoyuink/dsh-image-vision
Releases · xiaoyuink/dsh-image-vision
Release list
v2.4.0 — API Key 安全存储
v2.4.0 更新内容
🔒 API Key 安全存储(本次核心改动)
- API Key 不再明文写入 settings.yaml:设置页填写明文 Key 后,服务端自动写入 DSH 凭据存储(~/.dsh/.credentials.yaml),settings.yaml 只保留 \cred:REF\ 引用
- 新增 \cred:REF\ 引用支持:走 DSH 凭据服务分层解析(环境变量 → .credentials.yaml → .env),凭据服务不可用时回落到环境变量
- 凭据服务不可用或写入失败时返回 500 拒绝保存,任何路径都不会把密钥明文落进 settings.yaml
- 测试 / 模型发现 / 余额查询路由现在能正确解析 \cred:\ / \env:\ 引用
- 回显脱敏逻辑统一:\env:\ / \cred:\ 引用原样显示(引用不是密钥本身),明文照旧脱敏为占位符
其他
- 包名统一为 @xiaoyuink/dsh-image-vision\ scope
- .gitignore 补充 package/ 与 package-lock.json
安装
\\�ash
git clone https://github.com/xiaoyuink/dsh-image-vision.git
cd dsh-image-vision && pnpm install
dsh plugin --profile web add <插件目录绝对路径>
\\
或下载本 Release 的 \xiaoyuink-dsh-image-vision-2.4.0.tgz\,解压后 add 解压得到的 \package/\ 目录。
v2.3.1
v2.3.1 主要变更
API Key 安全增强
- 回显脱敏:
GET /api/dsh-image-vision/config不再返回明文 Key(显示********占位) env:环境变量引用:apiKey可写成env:VISION_API_KEY,从进程环境变量读取,配置文件不落明文- 留空不改:设置页 Key 密码框初始为空,留空保存 = 保留原 Key,填入新值即替换
- 占位提示:未配置 / 已配置-输入新值可替换
- 测试/发现/余额路由提交脱敏 Key 时按 baseUrl 回落当前配置真实 Key
彻底移除「+ 自动识图」视觉组
- 删除 twin 注册/适配器/同步逻辑与 👁 渲染器,模型选择器保持简洁(不再出现「X + 视觉」条目/开关)
- 图片发送完全由发送层 hook 独立承担(附件存储 + 消息区缩略图 + ground/crop/ocr 精读链路不受影响)
- 保留 attachment→草稿物化桥(
resolveImageRef附件引用解析依赖)
其他
- 设置页文案精简;若干渲染/交互 bug 修复
安装
# 方式一:本地目录
dsh plugin --profile web add <解压目录>
# 方式二:下载本 Release 的 dsh-image-vision-2.3.1.tgz安装后重启 dsh web 生效。完整文档见 README。
v2.3.0
v2.3.0 主要变更
- 发送链路重构:图片改存 DSH 附件存储(
attachments.saveImage,永久、内容寻址),消息改写为附件引用(元数据编进 URL,重启后旧引用仍可渲染与精读) - 新增路由:
POST /api/dsh-image-vision/attach(附件存储写入)、GET /api/dsh-image-vision/raw/<id>(附件回读)、GET /api/dsh-image-vision/current-model-vision(当前模型识图能力查询) - 工具支持附件引用(复用 attachment→草稿物化桥):
image_vision/image_vision_ocr/image_vision_ground/image_vision_crop像素精读链路直接可用 - 「+ 自动识图」视觉组默认关闭(新增
visionGroup配置):模型选择器保持简洁,需要旧体验时可开启 - 消息区图片渲染:引用升格为缩略图,点击全屏查看大图;加载失败自动恢复原文
- 总开关语义:关闭时拦截粘贴图片;修复拖拽浮层卡死、预览过滤器漏认附件引用、设置页文案等问题
- 兼容旧草稿引用(
i/iv-…,20 分钟临时语义保留)
安装
# 方式一:本地目录
dsh plugin --profile web add <解压目录>
# 方式二:下载本 Release 的 dsh-image-vision-2.3.0.tgz安装后重启 dsh web 生效。完整文档见 README。
v2.2.1
v2.2.0
v2.2.0
✨ 新特性
- 总开关
enabled:settings.yaml 新增enabled字段;关闭时不再注册「+ 视觉」组,模型选择器保持干净 - 草稿 20 分钟过期:草稿图片保存 20 分钟后由定时器自动清理,目录统一为
~/.dsh/plugin/image-vision/drafts/ - 视觉模型覆盖表:内置
KNOWN_VISION_OVERRIDES(gpt-5.x / grok-4.5 / minimax-m3 / qwen3.x 等权威判定,优先于正则猜测) - 「+ 自动识图」更名「+ 视觉」:视觉模型条目名带 👁 标记,厂商组内更直观
- 新厂商模板:OpenCode Zen Go
- 检测结果折叠进按钮:设置页「检测」按钮直接显示
✓ 延迟/✗ 失败,完整内容放悬停提示,不再撑高卡片
🔧 修复与优化
- 草稿目录修正为插件安装目录
~/.dsh/plugin/image-vision/drafts/ - API 错误信息解析兼容 OpenAI / DashScope / one-api 等格式
- host 侧新增
parseApiErrorMessage/configHasVisionModel,总开关关闭时注销全部视觉组
📦 安装
git clone https://github.com/xiaoyuink/dsh-image-vision.git
cd dsh-image-vision && pnpm install
dsh plugin --profile web add <插件目录绝对路径>详见 README。
v2.1.0
v2.1.0 更新内容
🆕 新增
- 像素级视觉工具
image_vision_crop:按像素坐标裁剪图片局部并放大,返回新图片引用,可继续传给其他视觉工具,形成“定位 → 裁剪 → 放大 → 再识别”闭环。image_vision_ground:在图片中定位目标(按钮 / 文字 / 物体等),返回像素 bbox。image_vision_ocr:逐字识别图片中的可见文字,配合 crop 放大局部效果更好。
- OVHcloud 免费视觉层(免注册、免 Key)
- 设置页新增「⚡ 一键添加 OVH 免费视觉层(免 Key)」按钮。
- 支持 OVH 匿名端点(每 IP / 模型 2 次/分钟),无需填写 API Key。
- 图片引用解析增强
- 支持完整 URL(
http(s)://.../i/xxx或 draft-image URL)、草稿短名(i/iv-xxx.jpg/iv-xxx.jpg)和本地绝对路径。
- 支持完整 URL(
- 新增 sharp 运行时依赖,用于裁剪 / 放大图片;采用动态加载,sharp 不可用时不影响插件本体启动。
🔧 修复 / 优化
- 修正 Qwen 系列视觉模型启发式判断:只有
qwen-*-vl/omni/image/vision/ocr等子型号判为可识图,避免裸 qwen(plus / max / coder 等)被误判为视觉模型。 - 模型实测的错误识别更准确:补充
not a multimodal model、vision not、text-only等特征,更好提示“该模型不支持图片输入”。 - 缺少 API Key 时按端点区分提示:OVH 免费层可留空,其它端点明确提示需填写 Key。
- 打包配置增加
files白名单,发布包不再夹带旧 tgz 等多余文件。
v2.0.0
dsh-image-vision v2.0.0
图片识别插件:DeepSeek Harness 纯文本 Agent 的「眼睛」。
核心特性
- 对话框直接粘贴/上传图片:注册「+ 自动识图」twin 模型路由(声明图片输入,通过 DSH 发送准入),图片走 DSH 原生草稿流程——输入框缩略图预览、对话中显示图片、发送后模型自动识别
- image_vision 工具:自动判断当前模型是否可识图;可识图则交给当前模型,否则调用插件配置的视觉模型(支持 OpenAI/Anthropic 兼容端点,多供应商管理)
- 7 种专业识别预设:病理 / 细胞 / 解剖 / 统计图 / 组合大图 / 临床 / 通用
- 模型输入层改写:image block 落盘为短标记,DeepSeek 只见文本,会话日志保留图片
- realtime 模型大图自动降级:超过帧限制自动走 OpenAI 兼容接口
设置页
- 多供应商管理:添加/编辑/删除、拖拽排序(卡片 + 模型行)、模型收纳折叠、余额查询、模型检测
- 视觉模型选择器(输入框内快速切换)
安装
dsh plugin --profile web add <插件目录>或直接下载本包后用 dev_install_package 热装配。
使用
- 聊天页右下角模型选择器选「DeepSeek + 自动识图」(或其它 + 自动识图组)
- 直接粘贴/拖拽/📎 上传图片
- 发送后对话区显示图片,模型自动调用 image_vision 识别
v1.0.0
dsh-image-vision v1.0.0(初始版)
图片识别插件早期版本:image_vision 工具 + 多供应商视觉模型管理(设置页)。
功能
image_vision工具:自动判断当前模型是否具备识图能力,有则交给当前模型,无则调用插件配置的视觉模型- 7 种专业识别预设:病理 / 细胞 / 解剖 / 统计图 / 组合大图 / 临床 / 通用
- 设置页:多供应商添加/编辑/删除、模型发现(识图/非识图判定)、模型实测(内置测试图)、余额查询、厂商模板
- 图片参数仅支持本地绝对路径
注:后续版本已重构为「+ 自动识图」twin 路由 + DSH 原生图片输入链路,请优先使用 v2.0.0。