Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

6 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

📝 OCR图像文字识别工具:让那些该死的图片终于能说人话了

又要从图片里手动抄文字?去他*的!这个工具就是来拯救你这个可怜虫的。它用OpenAI的API从图片中提取文字,比你那位只会在午餐时间消失的实习生强多了。

👍 为什么你应该立刻用这玩意儿

  • 图形界面傻瓜到连你那只会开罐头的猫都能操作
  • 批量处理图片,因为谁TM有时间一张一张点?生活已经够糟了!
  • 自定义API设置,随便折腾,反正又不是我的钱包在流血
  • 进度条实时显示,这样你就知道还有多久能摆脱这个烂活儿去喝一杯
  • 图像预览功能,看看这破程序到底在处理什么鬼东西
  • 所有结果保存到一个文件里,不会像你那混乱的感情生活一样四处散落

🛠️ 安装这破玩意儿前你需要的东西

  1. Python 3.7或更高版本(用Python 2的都是什么远古生物,赶紧进博物馆吧)
  2. 一堆依赖包(全在requirements.txt里,别问我是什么,你难道不会谷歌吗?)
  3. 或者用Docker(如果你是那种"容器化一切"的狂热分子)

🚀 安装步骤,简单到连你都能办到

方法一:老派安装(适合怀旧的古董)

  1. 把代码库弄到你那台破电脑上(对,就是那个绿色按钮,瞎了吗?)
  2. 安装依赖:
pip install -r requirements.txt

(如果这一步失败了,恭喜,你比99%的白痴多了一个错误)

方法二:Docker版(给那些觉得自己很酷的容器狂热粉)

  1. 构建镜像(是的,你得先把Docker装好,这还用我教?):
docker build -t ocr-app .

(这个点别漏了,不然你会收到Docker发来的"你是不是傻"提示)

  1. 运行容器(比你约会对象靠谱多了,至少它不会放你鸽子):
docker run -d -p 5001:5000 ocr-app

(现在访问localhost:5001,瞧,魔法出现了!)

🎮 使用指南——即使是宿醉的你也能操作

  1. 启动这坨程序:
python ocr_app.py

(如果用Docker,你已经在运行了,白痴。直接打开浏览器访问localhost:5001)

  1. 在那个丑不拉几的界面中:
    • 点"Browse"选择图片文件夹(不,它不会读你脑子里的废话)
    • 输入API密钥(别用你的银行卡密码,蠢货)
    • 调整其他狗屁设置(或者懒得看就用默认的,我们都是这么过来的)
    • 给输出文件起个名(实在没创意就叫"我很懒.txt"得了)
    • 点"Start Processing",然后该干嘛干嘛去,这破程序会自己跑完
  2. 处理过程中:
    • 进度条会告诉你还得等多久,比你那个永远"还有5分钟就到"的朋友靠谱多了
    • "Results"页面会显示识别出的文字,看看AI到底有多蠢(或者有多聪明,该死)
    • 所有结果都会被保存,就算你手贱关窗口也不会像你的前任一样彻底消失

💼 API兼容性(装逼部分)

这破程序不仅能用OpenAI的API,还能用其他山寨版的API。管它是哪家的,能用就行,我们又不挑食。

⚠️ 注意事项(或者说:如何不把事情搞得更糟)

  • 确保你有API访问权,不然这程序就跟你的新年决心一样,只是个摆设
  • 处理高清图片会烧钱,比你在酒吧买醉还快,所以悠着点用
  • 默认用"gpt-4-vision-preview"这个贵得要死的模型,想省钱自己换个便宜的
  • Docker版运行后,别忘了它在5001端口,不然你会像个白痴一样到处找它在哪

祝你好运,混蛋!希望这破工具能让你少加班,多去做些有意思的事,比如找个人生目标什么的。

About

llm语言模型识别图片文字内容

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Used by

Contributors

Languages