Skip to content

v0.3.0

Choose a tag to compare

@github-actions github-actions released this 09 Aug 14:10
91fbbe3

deepseek-vision 0.3.0 重点加入 Agent 图片二次聚焦分析、按顺序执行的视觉模型回退,以及可安全返回给客户端的失败诊断。插件仍通过 CLIProxyAPI 的宿主模型执行接口工作,不需要修改 CLIProxyAPI,也不新增 server-side tool。

延迟说明: 图片请求会先等待 vision_model(以及必要时的 fallback 模型)完成识图,再交给最终文本模型。Agent 使用 view_image 重新识图时也会发起一次新的视觉分析并等待上游返回。因此,带图请求和重新识图比纯文本请求更慢是正常现象;上游拥塞、限流或 fallback 会进一步增加等待时间,最终受 request_timeout_seconds 限制。

Highlights

  • 支持 Codex view_image 图片二次聚焦分析:Agent 可针对当前任务重新查看工具输出中的真实图片,并以最新 focus 生成专项分析

该功能默认关闭,启用请配置 agent_reanalysis_enabled : true 或在management.html设置中启用

  • 提供通用 deepseek_vision_reanalyze 契约,支持匿名 attachment_ids、显式 focushigh/original detail,以及 refresh/no_store 缓存模式
  • 严格关联当前请求末尾的工具调用与图片输出;历史、未知、未声明或无法关联的工具结果仍按普通图片处理
  • 新增 vision_fallback_models:主视觉模型遇到可重试失败后,最多按顺序尝试 3 个 fallback 模型
  • 失败时返回结构化 502:包含随机 error_id、安全的失败类别、模型标签、HTTP 状态和 retryable,不暴露上游正文、图片引用、路径、响应头或凭据
  • refresh 支持相同 call ID 的幂等重放;no_store 不读写跨请求缓存;URL 图片可通过显式 refresh 避免复用旧分析
  • Management 配置页现已提供 target_modelsvision_modelvision_fallback_modelsagent_reanalysis_enabled 等字段
  • 默认继续脱敏 Codex 附件路径;只有显式启用 Agent 重分析并满足严格路径约束时,才允许文本模型按需重新打开附件
  • 已收录到 CLIProxyAPI 官方插件源,可从插件商店安装和更新

Upgrade

现有 YAML 无需迁移。新增配置均有兼容默认值:

  • target_models: 需要视觉预处理的最终文本模型,默认 ["deepseek-v4-flash"]
  • vision_model: 主视觉模型,默认 gpt-5.6-luna
  • vision_fallback_models: 有序 fallback 数组,默认空,最多 3 个
  • agent_reanalysis_enabled: 受控 Agent 图片重分析,默认 false

Management 配置页中的数组字段可这样填写:

target_models

[
  "deepseek-v4-flash"
]

vision_fallback_models(按顺序尝试):

[
  "gemini-3.5-flash",
  "glm-4.6v-flash"
]

主模型仍由 vision_model 配置。

普通无图片请求、非目标模型和不匹配的协议路径仍原样旁路。图片预处理失败继续保持原子 fail-closed,不会把原始图片或部分改写请求发送给不支持视觉的最终模型。

Support

  • CLIProxyAPI SDK 基线:v7.2.119
  • 宿主进程与动态加载验证:v7.2.119v7.2.121
  • 发布验收目标:deepseek-v4-flash
  • Linux、macOS、Windows:amd64 / arm64

发布前已完成真实 DeepSeek、真实视觉上游、Codex view_image 工具循环和强制 503 → fallback trace 验证。发布资产包含六个平台压缩包与 checksums.txt

中文文档 · English · Installation · 完整变更