Skip to content

Releases: chen7447/rapidocr-for-zotero

RapidOCR for Zotero 2.1.0

Choose a tag to compare

@chen7447 chen7447 released this 07 Sep 08:42
  • 修复双栏/小密字英文丢词间空格:rec 模型在双栏正文与小型字上不发空格类导致复制粘连,解码时按次强 Space 置信度与超长字符间距双证据补回(宽字母豁免,中文不受影响)
  • 减轻 OCR 进行中的界面顿挫:移除每页 800 万像素级的主线程诊断全扫,改为稀疏采样白页检测

RapidOCR for Zotero 2.0.2

Choose a tag to compare

@chen7447 chen7447 released this 07 Sep 06:11

修复扫描件 OCR 白屏:pdf.js 6 对 jar:/resource: 资源走 XMLHttpRequest 而沙箱没有 XHR,CCITT/JBIG2 解码失败致整页空白。现改用与模型一致的 fetch() 加载 wasm 解码器,图片型 PDF(专利扫描件等)可正常识别。

RapidOCR for Zotero 2.0.1

Choose a tag to compare

@chen7447 chen7447 released this 07 Sep 04:49
  • 「去画选择区域」入口:OCR 弹窗新增按钮,一键切换到 Zotero 原生「选择区域」工具。画完回来点 OCR,圈内优先识别。
  • 弹窗界面重排:检测参数收进默认折叠的「高级设置」,主路径更清爽;弹窗随系统亮暗主题配色,数字参数附白话提示,主按钮显示目标页码。
  • 弹窗视觉统一:OCR/删除/去画选择区域三按钮统一居中,配扫描框与橡皮擦图标。
  • 「OCR 过程图」运行期开关:分阶段诊断图改由帮助菜单 checkbox 控制,测试时不必改代码注释;默认关闭。

RapidOCR for Zotero 2.0.0

Choose a tag to compare

@chen7447 chen7447 released this 07 Sep 02:30
  • 圈选区域修复:Zotero「选择区域」标注按 PDF 原生页底原点坐标解释(y 翻转),框选命中从此精确
  • 圈选优先、圈外补足:整页检测一次,圈内行先输出,圈外行照常识别接在后面;勾「双栏版面」时补足部分先左栏后右栏
  • 双栏阅读序:标题、摘要等横贯带切区,区内先左栏后右栏
  • 高分辨率抢救:识别未返回的小字行(邮箱、DOI、脚注)按 4 倍分辨率重渲染重识别
  • 修复垃圾过滤误杀:合法文本中的 9999 等重复串不再被当作识别伪影丢弃
  • 整行完整写入:被圈盖住一半以上的整行完整输出,含跨框行
  • 修复:Zotero 重启后,随 PDF 恢复打开的阅读器里顶格 OCR 工具栏按钮不再出现(会话恢复竞态)
  • 修复实现:工具栏监听注册提前到所有异步初始化之前,并对已打开的 PDF 阅读器做幂等补挂

RapidOCR for Zotero 1.9.2

Choose a tag to compare

@chen7447 chen7447 released this 29 Aug 07:02

1.9.1 → 1.9.2 更新内容

稳定性修复

  • 修复:文件名不带 .pdf 后缀时,OCR 输出可能覆盖源 PDF——现在保证输出路径与源文件不同,无法推导时中止且不写盘
  • 修复:偏好设置中的合法 0 值(如倾斜文字过滤设为 0 = 不过滤、灵敏度设 0)不再被静默回退为默认值,偏好页显示与实际生效一致
  • 修复:批量 OCR 遇到已排队/运行中的附件时提示「N 个附件已在队列中,已跳过」,不再静默丢弃剩余任务

队列可视化进度窗

  • OCR 进度窗升级为任务队列视图:每个 PDF 一张独立卡片(进度条、状态、双计时器),多任务同时可见
  • 每张卡片右下角独立「取消」按钮:可精确取消运行中或排队中的任意一个任务;「全部取消」一键清空队列
  • 排队中的任务显示「等待中…(等待《某文件》完成)」;窗口每秒自检,卡片顺序/显示自动校正;完成与取消的卡片自动清理,不残留到下一批

性能

  • 图像预处理三遍流水线(缩放/归一化/重排)融合为单遍,输出逐位一致(参照实现测试保证)
  • 模型文件每个任务只读取一次(原为每个并行核心各读一遍,8 核省约 7×28MB IO)

界面语言

  • 简单适配英语:跟随 Zotero 界面语言,中文界面显示中文,其他语言显示英文(含偏好设置页全部说明文字)
  • 安装包仅增大约 6KB

工程

  • 新增 CI(typecheck / 单元测试 / 打包 / XPI 校验),单元测试 96 项

RapidOCR for Zotero 1.9.1

Choose a tag to compare

@chen7447 chen7447 released this 27 Aug 19:57

1.7.2 → 1.9.1 更新内容

性能与并行

  • 多核页级并行:N 个单线程 WASM worker 池,每核分多页并行 OCR(实测:Ryzen 7 6800HS,单核 10 页 3min,4 核 1min20s,耗时缩短 55.6%、提速 2.25 倍)
  • 并行模型初始化:各 worker 线程同时编译模型
  • 单页框级并行:OCR 当前页 先整页 det 出文本框数 x,按 k=⌈x/n⌉ 连续分组、n 核并行 rec
  • 并行核心数可调(1~8,默认 4)

识别质量

  • 识别模式三选:直立正文 / 倾斜正文 / 复合方法(自动判断,默认)
  • 倾斜文字过滤(maxRotDeg)
  • 检测分辨率可调 512~1920,新增 1920 支持 A3 大幅面扫描件
  • NMS 去重,阅读顺序排序

UI 与交互

  • 右键 OCR PDF 前弹出微调设置面板(仅本次生效,不写回偏好)
  • 阅读器顶栏「OCR 当前页」按钮,含完整参数与核心数设置
  • 进度对话框双计时器(总用时,RapidOCR 已运行)与分段进度

稳定性

  • 右键菜单兜底:加载时/注销后主动触发 MenuManager 重建,缓解 Zotero 菜单 bug
  • 设置面板下拉改 radio 按钮组,解决 about:blank 窗口原生 select 不弹问题

2026-08-28 更新:偏好页显示名由「PDF OCR」改为「RapidOCR for Zotero」(与插件名称一致,功能无变化)。xpi 已重新上传覆盖。

RapidOCR for Zotero 1.7.2

Choose a tag to compare

@chen7447 chen7447 released this 26 Aug 19:11

v1.7.2

修复 PDF 阅读器顶栏“OCR 当前页”按钮图标在 iframe 沙箱中不显示的问题。

  • 图标改为 data URI 内联 SVG + currentColor,复用插件同一份 pdf-ocr.svg 路径
  • 跟随主题色(浅色主题深图标 / 深色主题浅图标)
  • 兼容 Zotero 9 / 10

RapidOCR for Zotero 1.7.1

Choose a tag to compare

@chen7447 chen7447 released this 25 Aug 22:39

RapidOCR for Zotero 1.7.1

  • 新增 1920 分辨率选项,偏好页和阅读器工具栏均可选
  • 对 A3/大版面扫描件有明显提升,默认仍是 1536

RapidOCR for Zotero 1.7.0

Choose a tag to compare

@chen7447 chen7447 released this 25 Aug 00:05

RapidOCR for Zotero 1.7.0

开装即用。 不装 Python,不装 Tesseract,不装 OCRmyPDF。下载本页的 .xpi,拖进 Zotero → 右键 OCR PDF。

安装

  1. 下载 pdf-ocr-for-zotero-1.7.0.xpi
  2. Zotero → 工具 → 插件 → 拖入 xpi(或齿轮 → 从文件安装插件)
  3. 建议重启 Zotero

使用

  1. 选中带 PDF 的条目或 PDF 附件
  2. 右键 → OCR PDF
  3. 完成后同一条目下会出现 [OCR] 附件(*-ocr.pdf),可搜索、选择、复制、翻译
  4. 源 PDF 不会被覆盖

打开 [OCR] PDF 时,阅读器工具栏可以 OCR 当前页 或 删除 OCR 文字层。会先关掉该 PDF,写完再打开。

推荐设置(编辑 → 设置 → PDF OCR):检测分辨率 1536,灵敏度 0.3,文本框过滤 0.4。

手册见仓库 README。

RapidOCR for Zotero 1.6.0b6

Choose a tag to compare

@chen7447 chen7447 released this 24 Aug 19:54

RapidOCR for Zotero 1.6.0b6

开装即用。 不装 Python,不装 Tesseract,不装 OCRmyPDF。下载本页的 .xpi,拖进 Zotero → 右键 OCR PDF。

安装

  1. 下载 pdf-ocr-for-zotero-1.6.0b6.xpi
  2. Zotero → 工具 → 插件 → 拖入 xpi(或齿轮 → 从文件安装插件)
  3. 建议重启 Zotero

使用

  1. 选中带 PDF 的条目或 PDF 附件
  2. 右键 → OCR PDF
  3. 完成后同一条目下会出现 [OCR] 附件(*-ocr.pdf),可搜索、选择、复制、翻译
  4. 源 PDF 不会被覆盖

推荐设置(编辑 → 设置 → PDF OCR):检测分辨率 1536,灵敏度 0.3,文本框过滤 0.4。

手册见仓库 README。这是 Beta:公式、极小字、纯英文文献效果通常不如调好的 OCRmyPDF。