本项目旨在开发一个面向“自动控制原理”课程的深度 RAG(检索增强生成)问答系统。通过集成轻量化大语言模型与专业知识库,解决复杂控制理论问题的精准检索与智能化解答,作为高效的辅助学习工具。
- 大规模专业语料:基于 1247 条原始知识片段,成功合成了 5000+ 条高质量 QA 数据对,覆盖自控原理核心章节。
-
专业数学支持:支持 LaTeX 公式渲染,确保传递函数
$$G(s)$$ 、状态空间表达式等公式在 Markdown 环境下清晰显示。 - 高性能检索:采用 FAISS 本地向量数据库,实现毫秒级知识点定位与语义匹配。
- 拒绝虚假回答:内置检索相关度阈值过滤逻辑,有效抑制模型幻觉,确保回答的严谨性。
本项目采用模块化开发,各环节脚本说明如下:
step01_process_data.py:语料清洗与文本分块处理,将教材内容转化为检索单元。step02_build_db.py:基于 FAISS 的向量数据库构建,实现语义索引。step03_test_llm.py:本地环境(CPU 版)大模型基础调用测试与角色定制。step04_rag_cloud.py:云端(GPU)RAG 全链路推理测试,实测推理速度达 24.52 tokens/s。step05_data_augmentation_cloud.py:大规模数据增强生产脚本,用于云端全量合成 5000+ 题库。step05_data_augmentation_local.py:数据增强逻辑优化脚本,含 JSON 解析鲁棒性修复逻辑。
check_gpu.py:GPU 算力资源可用性检测脚本。benchmark.py:系统性能基准测试与云端环境验证。data/:存放原始语料及分块后的中间数据。images/:存放实验过程截图及 README 资源。notebooks/:存放 Kaggle 实验笔记。
- 硬件建议:生产环境推荐使用 GPU(Tesla T4 或更高),本地环境支持 CPU 推理。
- 软件依赖:Python 3.10+
请在终端执行以下命令安装核心依赖库:
pip install langchain transformers faiss-cpu sentence-transformers torch accelerate