v0.3.0
deepseek-vision 0.3.0 重点加入 Agent 图片二次聚焦分析、按顺序执行的视觉模型回退,以及可安全返回给客户端的失败诊断。插件仍通过 CLIProxyAPI 的宿主模型执行接口工作,不需要修改 CLIProxyAPI,也不新增 server-side tool。
延迟说明: 图片请求会先等待
vision_model(以及必要时的 fallback 模型)完成识图,再交给最终文本模型。Agent 使用view_image重新识图时也会发起一次新的视觉分析并等待上游返回。因此,带图请求和重新识图比纯文本请求更慢是正常现象;上游拥塞、限流或 fallback 会进一步增加等待时间,最终受request_timeout_seconds限制。
Highlights
- 支持 Codex
view_image图片二次聚焦分析:Agent 可针对当前任务重新查看工具输出中的真实图片,并以最新 focus 生成专项分析
该功能默认关闭,启用请配置 agent_reanalysis_enabled : true 或在management.html设置中启用
- 提供通用
deepseek_vision_reanalyze契约,支持匿名attachment_ids、显式focus、high/originaldetail,以及refresh/no_store缓存模式 - 严格关联当前请求末尾的工具调用与图片输出;历史、未知、未声明或无法关联的工具结果仍按普通图片处理
- 新增
vision_fallback_models:主视觉模型遇到可重试失败后,最多按顺序尝试 3 个 fallback 模型 - 失败时返回结构化 502:包含随机
error_id、安全的失败类别、模型标签、HTTP 状态和 retryable,不暴露上游正文、图片引用、路径、响应头或凭据 refresh支持相同 call ID 的幂等重放;no_store不读写跨请求缓存;URL 图片可通过显式 refresh 避免复用旧分析- Management 配置页现已提供
target_models、vision_model、vision_fallback_models、agent_reanalysis_enabled等字段 - 默认继续脱敏 Codex 附件路径;只有显式启用 Agent 重分析并满足严格路径约束时,才允许文本模型按需重新打开附件
- 已收录到 CLIProxyAPI 官方插件源,可从插件商店安装和更新
Upgrade
现有 YAML 无需迁移。新增配置均有兼容默认值:
target_models: 需要视觉预处理的最终文本模型,默认["deepseek-v4-flash"]vision_model: 主视觉模型,默认gpt-5.6-lunavision_fallback_models: 有序 fallback 数组,默认空,最多 3 个agent_reanalysis_enabled: 受控 Agent 图片重分析,默认false
Management 配置页中的数组字段可这样填写:
target_models:
[
"deepseek-v4-flash"
]vision_fallback_models(按顺序尝试):
[
"gemini-3.5-flash",
"glm-4.6v-flash"
]主模型仍由 vision_model 配置。
普通无图片请求、非目标模型和不匹配的协议路径仍原样旁路。图片预处理失败继续保持原子 fail-closed,不会把原始图片或部分改写请求发送给不支持视觉的最终模型。
Support
- CLIProxyAPI SDK 基线:
v7.2.119 - 宿主进程与动态加载验证:
v7.2.119、v7.2.121 - 发布验收目标:
deepseek-v4-flash - Linux、macOS、Windows:amd64 / arm64
发布前已完成真实 DeepSeek、真实视觉上游、Codex view_image 工具循环和强制 503 → fallback trace 验证。发布资产包含六个平台压缩包与 checksums.txt。
中文文档 · English · Installation · 完整变更