Skip to content

v2.1.0

Choose a tag to compare

@xiaoyuink xiaoyuink released this 16 Aug 16:49
· 22 commits to main since this release

v2.1.0 更新内容

🆕 新增

  • 像素级视觉工具
    • image_vision_crop:按像素坐标裁剪图片局部并放大,返回新图片引用,可继续传给其他视觉工具,形成“定位 → 裁剪 → 放大 → 再识别”闭环。
    • image_vision_ground:在图片中定位目标(按钮 / 文字 / 物体等),返回像素 bbox。
    • image_vision_ocr:逐字识别图片中的可见文字,配合 crop 放大局部效果更好。
  • OVHcloud 免费视觉层(免注册、免 Key)
    • 设置页新增「⚡ 一键添加 OVH 免费视觉层(免 Key)」按钮。
    • 支持 OVH 匿名端点(每 IP / 模型 2 次/分钟),无需填写 API Key。
  • 图片引用解析增强
    • 支持完整 URL(http(s)://.../i/xxx 或 draft-image URL)、草稿短名(i/iv-xxx.jpg / iv-xxx.jpg)和本地绝对路径。
  • 新增 sharp 运行时依赖,用于裁剪 / 放大图片;采用动态加载,sharp 不可用时不影响插件本体启动。

🔧 修复 / 优化

  • 修正 Qwen 系列视觉模型启发式判断:只有 qwen-*-vl/omni/image/vision/ocr 等子型号判为可识图,避免裸 qwen(plus / max / coder 等)被误判为视觉模型。
  • 模型实测的错误识别更准确:补充 not a multimodal modelvision nottext-only 等特征,更好提示“该模型不支持图片输入”。
  • 缺少 API Key 时按端点区分提示:OVH 免费层可留空,其它端点明确提示需填写 Key。
  • 打包配置增加 files 白名单,发布包不再夹带旧 tgz 等多余文件。