Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

3 Commits
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

视觉大模型插件 🤖👁️

一个具有广泛支持的视觉大语言模型插件,用于文字识别(OCR)、翻译或任意自定义视觉任务。

功能特性 ✨

  • OCR文字识别: 精确识别图像中的文字内容
  • 智能翻译: 支持多种语言的图像文字翻译
  • 自定义功能: 通过自定义提示词实现个性化视觉任务
  • 高兼容性: 支持所有OpenAI兼容的视觉模型API(包括OpenAI, Gemini, Grok, Anthropic, Mistral, Qwen, OpenRouter, SiliconFlow等等市面上主流的大语言模型提供商的平台)
  • 多语言支持: 支持各种语言的识别和翻译
  • 高自定义性: 允许用户根据需求配置网络请求中的body参数

快速开始 📦

  1. Release 页面 下载最新版本的插件包
  2. 打开Pot Desktop, 依次点击服务设置->添加外部插件->安装外部插件
  3. 进入下载的插件包所在目录,选择插件包进行安装
  4. 点击视觉大语言兼容功能集, 开始配置相关参数
  • 填写模型平台基础urlAPI秘钥模型ID
    • 申请以及配置相关的内容可以在对应的模型提供平台的API文档中找到, 这里以阿里百炼大模型平台为例, 可以参考该链接
    • 注意: 所选用的模型必须支持视觉功能才可使用!!!
  • 选择功能识别翻译自定义
    • 默认为识别
    • 如果选择翻译,默认目标语言简体中文, 可以根据需要修改
    • 如果选择自定义,需要填写自定义提示词, 例如: 请分析这张图片中的内容,并总结出主要信息点, 请根据实际需求进行填写
  • 可选配置http_request设置(高级配置, 一般情况下不用填写)
    • 如需填写, 请使用JSON格式, 例如:
      {"temperature":0.1,"top_p":0.99,"frequency_penalty":0,"presence_penalty":0}

详细配置说明 ⚙️

必填参数

参数 说明 示例
模型平台基础url OpenAI兼容API的基础URL https://api.openai.com
API秘钥 模型平台的API密钥 sk-xxxxxxxxxxxx
模型ID 支持视觉功能的模型标识符 gpt-4o Qwen/Qwen2.5-VL-72B-Instruct

功能选择

功能 说明
识别 对图像进行OCR文字识别
翻译 识别并翻译图像中的文字
自定义 使用自定义提示词处理图像

可选参数

参数 说明 默认值
目标语言 翻译功能的目标语言 中文
自定义提示词 自定义功能时的系统提示词
http_request设置 自定义HTTP请求参数(JSON格式)

支持的语言 🌍

识别语言

  • 中文 (简体/繁体)
  • 英语 (English)
  • 日语 (日本語)
  • 韩语 (한국어)
  • 法语 (Français)
  • 西班牙语 (Español)
  • 俄语 (Русский)
  • 德语 (Deutsch)
  • 意大利语 (Italiano)
  • 土耳其语 (Türkçe)
  • 葡萄牙语 (Português)
  • 越南语 (Tiếng Việt)
  • 印尼语 (Bahasa Indonesia)
  • 泰语 (ไทย)
  • 马来语 (Bahasa Melayu)
  • 阿拉伯语 (العربية)
  • 印地语 (हिन्दी)
  • 蒙古语 (ᠮᠣᠩᠭᠣᠯ ᠬᠡᠯᠡ)
  • 高棉语 (ភាសាខ្មែរ)
  • 挪威语 (Norsk)
  • 波斯语 (فارسی)
  • 瑞典语 (Svenska)
  • 波兰语 (Polski)
  • 荷兰语 (Nederlands)
  • 乌克兰语 (Українська)

具体使用方法 🚀

1. OCR文字识别

  1. 选择功能为"识别"
  2. 配置基础URL、API密钥和模型ID
  3. 对图像进行识别,插件会:
    • 精确转录所有文字、数字和符号
    • 保持原始布局和结构
    • 使用Markdown格式输出
    • 将数学公式转换为LaTeX格式

2. 智能翻译

  1. 选择功能为"翻译"
  2. 选择目标语言(如:中文、英语、日语等)
  3. 配置其他必要参数
  4. 插件会:
    • 识别图像中的文字
    • 翻译为目标语言
    • 保持原始格式和布局
    • 数学公式保持LaTeX格式不变

3. 自定义功能

  1. 选择功能为"自定义"
  2. 填写自定义提示词,例如:
    请分析这张图片中的内容,并总结出主要信息点
    
  3. 插件会根据您的提示词处理图像

注意事项 ⚠️

  1. URL格式: 基础URL会自动添加/chat/completions路径
  2. API密钥: 确保API密钥有访问视觉模型的权限
  3. 模型支持: 确认所选模型支持图像输入功能
  4. 自定义提示词: 使用自定义功能时必须填写提示词
  5. JSON格式: 自定义HTTP请求设置必须是有效的JSON格式

错误处理 🔧

常见错误及解决方法:

  • "模型平台基础url不能为空": 请填写正确的API基础URL
  • "API秘钥不能为空": 请填写有效的API密钥
  • "模型ID不能为空": 请填写支持视觉功能的模型ID
  • "使用自定义功能时, 需要填写自定义提示词": 选择自定义功能时必须提供提示词
  • "自定义HTTP请求设置解析失败": 检查JSON格式是否正确

技术特点 🛠️

  • 高精度OCR: 使用先进的视觉语言模型确保识别准确性
  • 智能布局保持: 自动保持原始文档的格式和结构
  • 数学公式支持: 自动识别并转换数学公式为LaTeX格式
  • 多模态处理: 支持文字、图表、表格等多种内容类型
  • 错误处理: 完善的错误处理机制,不可读内容标记为[ILLEGIBLE]

贡献与反馈 🤝

如果您在使用过程中遇到问题或有改进建议,请访问项目主页提交Issue或Pull Request。

项目地址: https://github.com/TioSisai/OpenAI-compatible-Vision


让AI视觉理解变得更简单

About

可兼容多种大语言模型的pot desktop截图插件, 可直接图片翻译, 可OCR, 可高度自定义. (兼容所有支持传统OpenAI API调用格式的视觉模型)

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages