一个基于 Python + PySide6 开发的多功能文件处理桌面应用程序。
- DOCX 转 PDF:将 Word 文档转换为 PDF 格式
- PDF 转 DOCX:将 PDF 文档转换为 Word 格式
- 图片转 PDF:将多张图片合并为一个 PDF 文档
- PDF 合并:将多个 PDF 文件合并为一个
- PDF 拆分:将一个 PDF 文件拆分为多个文件
- OCR 文字识别:识别图片中的文字内容
- 提取 PDF 文本:从 PDF 文档中提取文本内容
- GUI 框架:PySide6 (Qt for Python)
- 文档处理:docx2pdf, pdf2docx
- PDF 处理:PyPDF2, pdfplumber
- 图片处理:Pillow (PIL)
- OCR 识别:pytesseract
- Python 3.8 或更高版本
- Windows 操作系统(docx2pdf 需要 Windows 和 Microsoft Word)
pip install -r requirements.txt如需使用 OCR 功能,需要安装 Tesseract OCR 引擎:
- 下载并安装 Tesseract OCR:https://github.com/UB-Mannheim/tesseract/wiki
- 将 Tesseract 安装路径添加到系统环境变量 PATH 中
python app.py- 点击"添加文件"或拖拽 DOCX 文件到文件列表
- 切换到"DOCX→PDF"标签页
- 点击"开始转换"按钮
- 选择输出目录
- 等待转换完成
- 点击"添加文件"或拖拽 PDF 文件到文件列表
- 切换到"PDF→DOCX"标签页
- 点击"开始转换"按钮
- 选择输出目录
- 等待转换完成
- 点击"添加文件"或拖拽图片文件到文件列表
- 切换到"图片→PDF"标签页
- 设置输出文件路径
- 点击"开始转换"按钮
- 点击"添加文件"或拖拽 PDF 文件到文件列表(至少2个及以上)
- 切换到"PDF合并"标签页
- 设置输出文件路径
- 点击"开始合并"按钮
- 点击"添加文件"或拖拽 PDF 文件到文件列表
- 切换到"PDF拆分"标签页
- 选择拆分模式(单页拆分或按范围拆分)
- 设置输出目录
- 点击"开始拆分"按钮
- 点击"添加文件"或拖拽图片文件到文件列表
- 切换到"OCR识别"标签页
- 选择识别语言
- 设置输出目录
- 点击"开始识别"按钮
- 点击"添加文件"或拖拽 PDF 文件到文件列表
- 切换到"提取文本"标签页
- 设置输出文件路径
- 点击"开始提取"按钮
DocTools/
├── app.py # 主程序入口
├── core/ # 核心功能模块
│ ├── __init__.py
│ ├── document_tool.py # 文档处理模块
│ ├── pdf_tool.py # PDF处理模块
│ ├── image_tool.py # 图片处理模块
│ ├── logger.py # 日志模块
│ └── utils.py # 工具函数模块
├── requirements.txt # 依赖包列表
└── README.md # 项目说明文档
- 文件占用问题:转换文档转换时,请确保目标文件未被其他程序(如 Word、Adobe Reader 等)打开
- OCR 功能:使用 OCR 功能需要安装 Tesseract OCR 引擎
- docx2pdf:DOCX 转 PDF 功能需要 Windows 系统和 Microsoft Word
- 批量处理:支持批量处理多个文件
- document_tool.py:负责 DOCX 和 PDF 之间的相互转换
- pdf_tool.py:负责 PDF 的合并、拆分和文本提取
- image_tool.py:负责图片转 PDF 和 OCR 文字识别
- logger.py:统一的日志管理
- utils.py:通用工具函数
本项目仅供学习和个人使用。
欢迎提交 Issue 和 Pull Request!