【Ideas】官方 API 何时开放图像输入?DSH 何时能用 read_image 读图? #1487
Replies: 2 comments
|
你第 3 个问题现在已经有完整可用的方案,尤其适合浏览器截图已经落在 workspace/本地路径里的场景:DeepSeek 继续做纯文本主模型,另一个 vision provider 只负责看图。 Pi 生态的 安装只需要 DSH 官方命令: dsh plugin --profile web add pi2dsh@0.11.0
dsh plugin --profile web add @kassing/pi-vision配置视觉端点后重启 DSH: export VISION_BRIDGE_BASE_URL=https://openrouter.ai/api/v1
export VISION_BRIDGE_MODEL=qwen/qwen2.5-vl-72b-instruct
export VISION_BRIDGE_API_KEY=$OPENROUTER_API_KEYpi2dsh 会自动为每条纯文本模型路由注册 DeepSeek + Vision Bridge 伴生分组,不需要手工修改模型声明。CLI 可以直接引用截图路径,Web 可以像原生 VLM 一样粘贴图片。 我们已在真实 DSH CLI 和 Web 两端验证:独立视觉模型识图 → 完整复现:https://github.com/weijiafu14/pi2dsh/tree/main/examples/vision-bridge |
|
Q1 没时间表。你测到的 400 和官方 changelog 对得上:公开 chat-completions 仍是 text-only, Q2 即使 API 开了, 过渡期想贴图进会话,和楼上「另挂一个 vision provider 看截图」不是同一刀。这边只补准入:纯文本主模型也能把图贴进输入框,不伪装官方已经支持图像,也不是 重启 |
Uh oh!
There was an error while loading. Please reload this page.
背景
DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813,2026-08-13)宣布「首次原生支持图像推理」(36氪实测报道),但公开 API 至今仍是 text-only。2026-08-14 用官方 API 实测:
POST https://api.deepseek.com/chat/completions,messages使用 OpenAI 兼容的image_url内容块 → HTTP 400:unknown variant 'image_url', expected 'text'@deepseek-ai/dsh-llm-deepseek将所有 DeepSeek 模型声明为inputModalities: ["text"],read_image对 deepseek-v4-pro 报「does not declare image input」想请教
image_url、文件上传还是独立 vision 端点?dsh-llm-deepseek适配器是否会同步声明 image 输入,read_image能否即开即用?场景
纯文本模型做网页自动化 / GUI 操作时,视觉核验(读截图确认填表结果、判断页面状态)目前只能人工代劳或外接第三方视觉模型。API 开放图像输入后,
read_image+ 浏览器截图即可让 agent 独立完成最后一环。All reactions