Skip to content

deepseek-vision-mcp v0.1.0

Latest

Choose a tag to compare

@JunHua-ECJTU JunHua-ECJTU released this 09 Aug 09:12
· 3 commits to main since this release

deepseek-vision-mcp v0.1.0

让纯文本 LLM Agent(如 DeepSeek)具备视觉能力的 MCP 服务:图片 / 视频 / 文件三种模态理解,基于智谱 GLM-4.6V-Flash(免费模型,128K 上下文)。

功能

  • vision_analyze_image:本地图片(自动 base64)或公网 URL
  • vision_analyze_video / vision_analyze_file:公网 URL(PDF / 文本等)
  • 可选思考模式(thinking)、3 次指数退避重试(429 尊重 Retry-After)、超时控制、结构化错误码
  • 配套 Skill(skills/vision-agent/):何时调用 / 参数规范 / 输出格式 / 降级策略

安装

pip install "deepseek-vision-mcp @ https://github.com/JunHua-ECJTU/deepseek-vision-mcp/releases/download/v0.1.0/deepseek_vision_mcp-0.1.0-py3-none-any.whl"

或下载本 Release 的 Assets:deepseek_vision_mcp-0.1.0-py3-none-any.whl(pip 安装)、deepseek_vision_mcp-0.1.0.tar.gz(源码包,含 skills/ 与测试)。

部署到任意 MCP 客户端 agent 的完整指南见 docs/DEPLOY.md

已知限制

  • 模态互斥:GLM-4.6V-Flash 不支持同时理解多种模态
  • 视频/文件仅支持公网 URL(智谱 /files 上传接口仅接受 .jsonl)
  • 免费模型高峰可能 429 限流(工具已内置重试)

智谱官方文档:https://docs.bigmodel.cn/cn/guide/models/free/glm-4.6v-flash