Skip to content

Releases: Zesuy/Plugin-Deepseek-Vision

v0.3.0

Choose a tag to compare

@github-actions github-actions released this 09 Aug 14:10
91fbbe3

deepseek-vision 0.3.0 重点加入 Agent 图片二次聚焦分析、按顺序执行的视觉模型回退,以及可安全返回给客户端的失败诊断。插件仍通过 CLIProxyAPI 的宿主模型执行接口工作,不需要修改 CLIProxyAPI,也不新增 server-side tool。

延迟说明: 图片请求会先等待 vision_model(以及必要时的 fallback 模型)完成识图,再交给最终文本模型。Agent 使用 view_image 重新识图时也会发起一次新的视觉分析并等待上游返回。因此,带图请求和重新识图比纯文本请求更慢是正常现象;上游拥塞、限流或 fallback 会进一步增加等待时间,最终受 request_timeout_seconds 限制。

Highlights

  • 支持 Codex view_image 图片二次聚焦分析:Agent 可针对当前任务重新查看工具输出中的真实图片,并以最新 focus 生成专项分析

该功能默认关闭,启用请配置 agent_reanalysis_enabled : true 或在management.html设置中启用

  • 提供通用 deepseek_vision_reanalyze 契约,支持匿名 attachment_ids、显式 focushigh/original detail,以及 refresh/no_store 缓存模式
  • 严格关联当前请求末尾的工具调用与图片输出;历史、未知、未声明或无法关联的工具结果仍按普通图片处理
  • 新增 vision_fallback_models:主视觉模型遇到可重试失败后,最多按顺序尝试 3 个 fallback 模型
  • 失败时返回结构化 502:包含随机 error_id、安全的失败类别、模型标签、HTTP 状态和 retryable,不暴露上游正文、图片引用、路径、响应头或凭据
  • refresh 支持相同 call ID 的幂等重放;no_store 不读写跨请求缓存;URL 图片可通过显式 refresh 避免复用旧分析
  • Management 配置页现已提供 target_modelsvision_modelvision_fallback_modelsagent_reanalysis_enabled 等字段
  • 默认继续脱敏 Codex 附件路径;只有显式启用 Agent 重分析并满足严格路径约束时,才允许文本模型按需重新打开附件
  • 已收录到 CLIProxyAPI 官方插件源,可从插件商店安装和更新

Upgrade

现有 YAML 无需迁移。新增配置均有兼容默认值:

  • target_models: 需要视觉预处理的最终文本模型,默认 ["deepseek-v4-flash"]
  • vision_model: 主视觉模型,默认 gpt-5.6-luna
  • vision_fallback_models: 有序 fallback 数组,默认空,最多 3 个
  • agent_reanalysis_enabled: 受控 Agent 图片重分析,默认 false

Management 配置页中的数组字段可这样填写:

target_models

[
  "deepseek-v4-flash"
]

vision_fallback_models(按顺序尝试):

[
  "gemini-3.5-flash",
  "glm-4.6v-flash"
]

主模型仍由 vision_model 配置。

普通无图片请求、非目标模型和不匹配的协议路径仍原样旁路。图片预处理失败继续保持原子 fail-closed,不会把原始图片或部分改写请求发送给不支持视觉的最终模型。

Support

  • CLIProxyAPI SDK 基线:v7.2.119
  • 宿主进程与动态加载验证:v7.2.119v7.2.121
  • 发布验收目标:deepseek-v4-flash
  • Linux、macOS、Windows:amd64 / arm64

发布前已完成真实 DeepSeek、真实视觉上游、Codex view_image 工具循环和强制 503 → fallback trace 验证。发布资产包含六个平台压缩包与 checksums.txt

中文文档 · English · Installation · 完整变更

v0.2.0

Choose a tag to compare

@github-actions github-actions released this 06 Aug 15:00
39efd1a

deepseek-vision 0.2.0 将图片预处理扩展到 CLIProxyAPI 的三种主流下游协议,同时继续由宿主负责上游协议翻译、模型路由、凭据与响应流。

Highlights

  • 新增 OpenAI Chat Completions /v1/chat/completions 图片改写
  • 新增 Anthropic Messages /v1/messages 图片改写,并返回原生 Anthropic 错误格式
  • 扫描完整可见消息历史,支持 Chat tool 消息、Responses function output 与 Claude tool_result 中的图片
  • 同一消息或工具结果内的多图联合分析,原协议字段、工具调用语义和内容顺序保持不变
  • HTTP(S)、data URI 与 Anthropic base64/url source 统一经过 URL、SSRF、base64 和大小限制校验
  • 保留 Responses 原有行为,并将请求规划重构为协议中立的 adapter/plan 架构
  • 修复 Codex Desktop 多轮 Responses 历史中的 reasoning 项 content: null 被误判为无效请求的问题;无图片请求恢复原样旁路,避免 invalid Responses request

Upgrade

无需配置迁移。现有 target_models 会自动作用于以下三条路由,这是 0.2.0 的有意行为扩展:

  • OpenAI Responses:openai-response + /v1/responses
  • OpenAI Chat Completions:openai + /v1/chat/completions
  • Anthropic Messages:claude + /v1/messages

不匹配的 source/path、非目标最终模型以及无图片请求仍原样旁路。图片预处理失败会保持原子 fail-closed,不会向业务上游发送部分改写请求。

Support

  • CLIProxyAPI v7.2.119
  • 插件 ABI 1、注册 schema 2
  • 已验证发布目标:deepseek-v4-flash
  • Linux、macOS、Windows:amd64 / arm64

仍不支持图片 file ID、隐藏服务端历史、文档/PDF、多媒体、响应流改写或独立上游凭据。流式下游请求可正常经过预处理,响应流仍完全由 CLIProxyAPI 管理。

发布资产包含六个平台压缩包与 checksums.txt

中文文档 · English · Installation · 完整变更

v0.1.1 — Initial Release

Choose a tag to compare

@Zesuy Zesuy released this 05 Aug 15:19

deepseek-vision 为 CLIProxyAPI v7 中的文本模型补充图片理解:复用宿主已有的视觉模型,将图片转换为可供目标模型使用的文本上下文。

Highlights

  • 通过 host.model.execute 复用宿主模型、路由与凭据
  • 同一 prompt 的多张图片联合分析
  • 请求去重、可配置缓存与全局并发背压
  • 原子 fail-closed 改写与可选完整调试 trace

Support

  • CLIProxyAPI v7.2.113
  • OpenAI Responses /v1/responses
  • 已验证目标:deepseek-v4-flash
  • Linux、macOS、Windows:amd64 / arm64

中文文档 · English · Installation