Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 
 
 
 
 
 
 

Repository files navigation

DocTools - 智能文件助手

一个基于 Python + PySide6 开发的多功能文件处理桌面应用程序。

功能特性

  • DOCX 转 PDF:将 Word 文档转换为 PDF 格式
  • PDF 转 DOCX:将 PDF 文档转换为 Word 格式
  • 图片转 PDF:将多张图片合并为一个 PDF 文档
  • PDF 合并:将多个 PDF 文件合并为一个
  • PDF 拆分:将一个 PDF 文件拆分为多个文件
  • OCR 文字识别:识别图片中的文字内容
  • 提取 PDF 文本:从 PDF 文档中提取文本内容

技术栈

  • GUI 框架:PySide6 (Qt for Python)
  • 文档处理:docx2pdf, pdf2docx
  • PDF 处理:PyPDF2, pdfplumber
  • 图片处理:Pillow (PIL)
  • OCR 识别:pytesseract

安装说明

环境要求

  • Python 3.8 或更高版本
  • Windows 操作系统(docx2pdf 需要 Windows 和 Microsoft Word)

安装依赖

pip install -r requirements.txt

可选依赖

如需使用 OCR 功能,需要安装 Tesseract OCR 引擎:

  1. 下载并安装 Tesseract OCR:https://github.com/UB-Mannheim/tesseract/wiki
  2. 将 Tesseract 安装路径添加到系统环境变量 PATH 中

使用指南

启动应用

python app.py

功能使用

1. DOCX 转 PDF

  1. 点击"添加文件"或拖拽 DOCX 文件到文件列表
  2. 切换到"DOCX→PDF"标签页
  3. 点击"开始转换"按钮
  4. 选择输出目录
  5. 等待转换完成

2. PDF 转 DOCX

  1. 点击"添加文件"或拖拽 PDF 文件到文件列表
  2. 切换到"PDF→DOCX"标签页
  3. 点击"开始转换"按钮
  4. 选择输出目录
  5. 等待转换完成

3. 图片转 PDF

  1. 点击"添加文件"或拖拽图片文件到文件列表
  2. 切换到"图片→PDF"标签页
  3. 设置输出文件路径
  4. 点击"开始转换"按钮

4. PDF 合并

  1. 点击"添加文件"或拖拽 PDF 文件到文件列表(至少2个及以上)
  2. 切换到"PDF合并"标签页
  3. 设置输出文件路径
  4. 点击"开始合并"按钮

5. PDF 拆分

  1. 点击"添加文件"或拖拽 PDF 文件到文件列表
  2. 切换到"PDF拆分"标签页
  3. 选择拆分模式(单页拆分或按范围拆分)
  4. 设置输出目录
  5. 点击"开始拆分"按钮

6. OCR 文字识别

  1. 点击"添加文件"或拖拽图片文件到文件列表
  2. 切换到"OCR识别"标签页
  3. 选择识别语言
  4. 设置输出目录
  5. 点击"开始识别"按钮

7. 提取 PDF 文本

  1. 点击"添加文件"或拖拽 PDF 文件到文件列表
  2. 切换到"提取文本"标签页
  3. 设置输出文件路径
  4. 点击"开始提取"按钮

项目结构

DocTools/
├── app.py                 # 主程序入口
├── core/                  # 核心功能模块
│   ├── __init__.py
│   ├── document_tool.py   # 文档处理模块
│   ├── pdf_tool.py      # PDF处理模块
│   ├── image_tool.py     # 图片处理模块
│   ├── logger.py         # 日志模块
│   └── utils.py         # 工具函数模块
├── requirements.txt       # 依赖包列表
└── README.md           # 项目说明文档

注意事项

  1. 文件占用问题:转换文档转换时,请确保目标文件未被其他程序(如 Word、Adobe Reader 等)打开
  2. OCR 功能:使用 OCR 功能需要安装 Tesseract OCR 引擎
  3. docx2pdf:DOCX 转 PDF 功能需要 Windows 系统和 Microsoft Word
  4. 批量处理:支持批量处理多个文件

开发说明

核心模块

  • document_tool.py:负责 DOCX 和 PDF 之间的相互转换
  • pdf_tool.py:负责 PDF 的合并、拆分和文本提取
  • image_tool.py:负责图片转 PDF 和 OCR 文字识别
  • logger.py:统一的日志管理
  • utils.py:通用工具函数

许可证

本项目仅供学习和个人使用。

贡献

欢迎提交 Issue 和 Pull Request!

About

文件处理助手,支持PDF,DOC,图片等格式相互转化

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages