Skip to content

v1.1.0: 任务调度4工具架构 + 分级模型配置

Choose a tag to compare

@Wjl1224734792 Wjl1224734792 released this 08 May 10:32
· 31 commits to main since this release

Breaking Changes

  • 移除 multimodal_grounding_augment 单工具入口,请使用新的 4 个独立工具
  • 移除文档类型支持(PDF/DOCX/PPTX/XLSX/TXT/MD)
  • 移除 maxVideoFrames / maxDocPages 配置项(不再需要)

新工具

工具 说明
visual_describe 场景描述(自然语言),先理解画面
visual_locate 坐标定位(JSON),注入 describe 上下文
visual_ocr 文字/表格提取
visual_video_analyze 视频内容分析

分级模型配置

VISION_API_BASE_URL=https://dashscope.aliyuncs.com/compatible-mode/v1
VISION_API_KEY=sk-xxx
VISION_MODEL_NAME=qwen3.5-plus        # 默认模型

# 可选:每工具独立模型
VISION_MODEL_DESCRIBE=qwen3.5-plus
VISION_MODEL_LOCATE=qwen3.5-plus
VISION_MODEL_OCR=qwen3.5-plus
VISION_MODEL_VIDEO=qwen3.5-plus

视频处理

视频通过 video_url 直接发送给视觉模型,不再使用 FFmpeg 抽帧。移除 ffmpeg-static / sharp / pdf-poppler 依赖。

推荐用法

visual_describe(image) → 理解场景
visual_locate(same_session, "找到提交按钮") → 获取坐标