一个具有广泛支持的视觉大语言模型插件,用于文字识别(OCR)、翻译或任意自定义视觉任务。
- OCR文字识别: 精确识别图像中的文字内容
- 智能翻译: 支持多种语言的图像文字翻译
- 自定义功能: 通过自定义提示词实现个性化视觉任务
- 高兼容性: 支持所有OpenAI兼容的视觉模型API(包括OpenAI, Gemini, Grok, Anthropic, Mistral, Qwen, OpenRouter, SiliconFlow等等市面上主流的大语言模型提供商的平台)
- 多语言支持: 支持各种语言的识别和翻译
- 高自定义性: 允许用户根据需求配置网络请求中的body参数
- 在 Release 页面 下载最新版本的插件包
- 打开Pot Desktop, 依次点击
服务设置->添加外部插件->安装外部插件 - 进入下载的插件包所在目录,选择插件包进行安装
- 点击
视觉大语言兼容功能集, 开始配置相关参数
- 填写
模型平台基础url、API秘钥和模型ID- 申请以及配置相关的内容可以在对应的模型提供平台的API文档中找到, 这里以阿里百炼大模型平台为例, 可以参考该链接
- 注意: 所选用的模型必须支持视觉功能才可使用!!!
- 选择
功能(识别、翻译或自定义)- 默认为
识别 - 如果选择
翻译,默认目标语言为简体中文, 可以根据需要修改 - 如果选择
自定义,需要填写自定义提示词, 例如:请分析这张图片中的内容,并总结出主要信息点, 请根据实际需求进行填写
- 默认为
- 可选配置
http_request设置(高级配置, 一般情况下不用填写)- 如需填写, 请使用JSON格式, 例如:
{"temperature":0.1,"top_p":0.99,"frequency_penalty":0,"presence_penalty":0}
- 如需填写, 请使用JSON格式, 例如:
| 参数 | 说明 | 示例 |
|---|---|---|
| 模型平台基础url | OpenAI兼容API的基础URL | https://api.openai.com |
| API秘钥 | 模型平台的API密钥 | sk-xxxxxxxxxxxx |
| 模型ID | 支持视觉功能的模型标识符 |
gpt-4o Qwen/Qwen2.5-VL-72B-Instruct |
| 功能 | 说明 |
|---|---|
| 识别 | 对图像进行OCR文字识别 |
| 翻译 | 识别并翻译图像中的文字 |
| 自定义 | 使用自定义提示词处理图像 |
| 参数 | 说明 | 默认值 |
|---|---|---|
| 目标语言 | 翻译功能的目标语言 | 中文 |
| 自定义提示词 | 自定义功能时的系统提示词 | 无 |
| http_request设置 | 自定义HTTP请求参数(JSON格式) | 无 |
- 中文 (简体/繁体)
- 英语 (English)
- 日语 (日本語)
- 韩语 (한국어)
- 法语 (Français)
- 西班牙语 (Español)
- 俄语 (Русский)
- 德语 (Deutsch)
- 意大利语 (Italiano)
- 土耳其语 (Türkçe)
- 葡萄牙语 (Português)
- 越南语 (Tiếng Việt)
- 印尼语 (Bahasa Indonesia)
- 泰语 (ไทย)
- 马来语 (Bahasa Melayu)
- 阿拉伯语 (العربية)
- 印地语 (हिन्दी)
- 蒙古语 (ᠮᠣᠩᠭᠣᠯ ᠬᠡᠯᠡ)
- 高棉语 (ភាសាខ្មែរ)
- 挪威语 (Norsk)
- 波斯语 (فارسی)
- 瑞典语 (Svenska)
- 波兰语 (Polski)
- 荷兰语 (Nederlands)
- 乌克兰语 (Українська)
- 选择功能为"识别"
- 配置基础URL、API密钥和模型ID
- 对图像进行识别,插件会:
- 精确转录所有文字、数字和符号
- 保持原始布局和结构
- 使用Markdown格式输出
- 将数学公式转换为LaTeX格式
- 选择功能为"翻译"
- 选择目标语言(如:中文、英语、日语等)
- 配置其他必要参数
- 插件会:
- 识别图像中的文字
- 翻译为目标语言
- 保持原始格式和布局
- 数学公式保持LaTeX格式不变
- 选择功能为"自定义"
- 填写自定义提示词,例如:
请分析这张图片中的内容,并总结出主要信息点 - 插件会根据您的提示词处理图像
- URL格式: 基础URL会自动添加
/chat/completions路径 - API密钥: 确保API密钥有访问视觉模型的权限
- 模型支持: 确认所选模型支持图像输入功能
- 自定义提示词: 使用自定义功能时必须填写提示词
- JSON格式: 自定义HTTP请求设置必须是有效的JSON格式
常见错误及解决方法:
- "模型平台基础url不能为空": 请填写正确的API基础URL
- "API秘钥不能为空": 请填写有效的API密钥
- "模型ID不能为空": 请填写支持视觉功能的模型ID
- "使用自定义功能时, 需要填写自定义提示词": 选择自定义功能时必须提供提示词
- "自定义HTTP请求设置解析失败": 检查JSON格式是否正确
- 高精度OCR: 使用先进的视觉语言模型确保识别准确性
- 智能布局保持: 自动保持原始文档的格式和结构
- 数学公式支持: 自动识别并转换数学公式为LaTeX格式
- 多模态处理: 支持文字、图表、表格等多种内容类型
- 错误处理: 完善的错误处理机制,不可读内容标记为[ILLEGIBLE]
如果您在使用过程中遇到问题或有改进建议,请访问项目主页提交Issue或Pull Request。
项目地址: https://github.com/TioSisai/OpenAI-compatible-Vision
让AI视觉理解变得更简单 ✨