给 DeepSeek Harness 装上看图的眼睛:Pi 生态两种识图能力,两条命令安装 #2040
weijiafu14
started this conversation in
Show Your Plugins!
Replies: 1 comment
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
给 DeepSeek Harness 装上看图的眼睛,同时把 Pi 插件生态直接接进来——这是 pi2dsh 最近完整跑通的能力。
Pi 有一套很丰富的 Agent 插件生态。pi2dsh 做的是一层通用 Pi Host ABI → DeepSeek Harness 兼容引擎:兼容的 Pi 插件保持 npm 上发布的原样,不 fork、不改源码,也不需要为每个包写一套转换代码。
安装只有两步
装完重启 DeepSeek Harness。pi2dsh 会从 profile 的显式依赖中发现并挂载 Pi 插件;引擎和插件可以分别升级,互不绑定。
给 DeepSeek Harness 装上看图的眼睛
DeepSeek 官方文本模型本身不接收图片,但很多 Agent 工作流又必须看截图、读图或检查页面。pi2dsh 会自动为每条 text-only 模型路由注册一个独立的 Vision Bridge 伴生路由,不需要手工修改模型能力声明。
模型选择器里会同时保留原始 DeepSeek 分组和独立的 DeepSeek + Vision Bridge 分组:
选择伴生分组后,Web 可以像使用原生多模态模型一样直接粘贴图片:
然后有两种工作方式可以选择。
方式一:自动识图
安装 @kassing/pi-vision:
它会在 DeepSeek 推理前调用你配置的视觉模型,把图片分析结果作为 Harness 原生的 context injection 注入。主模型不需要主动调用工具,直接基于分析后的文字回答。
OpenRouter is only a public example. DashScope/Qwen-VL, a self-hosted vLLM, or any OpenAI-compatible vision endpoint works the same way. The key comes from the environment and is never stored in pi2dsh source.
真实 Web 验证结果:
图中可以看到
pi2dsh:@kassing/pi-vision的上下文注入,纯文本 DeepSeek 在一轮一步内正确回答了图片颜色。方式二:Agent 按需识图
如果希望 Agent 自己决定什么时候看图,可以安装 pi-vision-tool:
这种方式先把视觉模型按 DSH 官方
llm-pi-ai配进$DSH_HOME/settings.yaml,然后选择该路由:完整的 DSH gateway 配置示例:https://github.com/weijiafu14/pi2dsh/tree/main/examples/custom-gateways
它提供
describe_image工具。Agent 可以按任务需要控制识图提示词、图片压缩和视觉推理深度,适合 OCR、UI 检查、错误截图分析、坐标定位和图片对比。已有 MCP / skill / script 只要能读取文件路径也可以直接复用:Vision Bridge 会把 Web 附件物化为临时文件,并把路径交给 Agent。
整条链路
在发往 DeepSeek 官方文本 adapter 前,图片块会被递归移除,因此文本模型接口始终只接收文字。
CLI 和 Web 两端都已完整跑通,仓库里提供了测试图片和从安装到复现的完整示例:
如果你也想把兼容的 Pi 生态插件直接用在 DeepSeek Harness 上,欢迎试用、提场景,也欢迎给项目一个 Star。
All reactions