deepseek-vision-mcp v0.1.0
让纯文本 LLM Agent(如 DeepSeek)具备视觉能力的 MCP 服务:图片 / 视频 / 文件三种模态理解,基于智谱 GLM-4.6V-Flash(免费模型,128K 上下文)。
功能
vision_analyze_image:本地图片(自动 base64)或公网 URLvision_analyze_video/vision_analyze_file:公网 URL(PDF / 文本等)- 可选思考模式(
thinking)、3 次指数退避重试(429 尊重 Retry-After)、超时控制、结构化错误码 - 配套 Skill(
skills/vision-agent/):何时调用 / 参数规范 / 输出格式 / 降级策略
安装
pip install "deepseek-vision-mcp @ https://github.com/JunHua-ECJTU/deepseek-vision-mcp/releases/download/v0.1.0/deepseek_vision_mcp-0.1.0-py3-none-any.whl"或下载本 Release 的 Assets:deepseek_vision_mcp-0.1.0-py3-none-any.whl(pip 安装)、deepseek_vision_mcp-0.1.0.tar.gz(源码包,含 skills/ 与测试)。
部署到任意 MCP 客户端 agent 的完整指南见 docs/DEPLOY.md。
已知限制
- 模态互斥:GLM-4.6V-Flash 不支持同时理解多种模态
- 视频/文件仅支持公网 URL(智谱 /files 上传接口仅接受 .jsonl)
- 免费模型高峰可能 429 限流(工具已内置重试)
智谱官方文档:https://docs.bigmodel.cn/cn/guide/models/free/glm-4.6v-flash