v1.1.0: 任务调度4工具架构 + 分级模型配置
Breaking Changes
- 移除
multimodal_grounding_augment单工具入口,请使用新的 4 个独立工具 - 移除文档类型支持(PDF/DOCX/PPTX/XLSX/TXT/MD)
- 移除
maxVideoFrames/maxDocPages配置项(不再需要)
新工具
| 工具 | 说明 |
|---|---|
visual_describe |
场景描述(自然语言),先理解画面 |
visual_locate |
坐标定位(JSON),注入 describe 上下文 |
visual_ocr |
文字/表格提取 |
visual_video_analyze |
视频内容分析 |
分级模型配置
VISION_API_BASE_URL=https://dashscope.aliyuncs.com/compatible-mode/v1
VISION_API_KEY=sk-xxx
VISION_MODEL_NAME=qwen3.5-plus # 默认模型
# 可选:每工具独立模型
VISION_MODEL_DESCRIBE=qwen3.5-plus
VISION_MODEL_LOCATE=qwen3.5-plus
VISION_MODEL_OCR=qwen3.5-plus
VISION_MODEL_VIDEO=qwen3.5-plus视频处理
视频通过 video_url 直接发送给视觉模型,不再使用 FFmpeg 抽帧。移除 ffmpeg-static / sharp / pdf-poppler 依赖。
推荐用法
visual_describe(image) → 理解场景
visual_locate(same_session, "找到提交按钮") → 获取坐标