AI PDF chatbot agent built with LangChain & LangGraph, provide multiple PDF parsing methods.
文档chunk优化:分析markdown文本ast结构进行chunk,提升召回效果。参考:https://gist.github.com/eavae/9b9cf289a17c2dd86fe42cbd17ede519
# ===================== ES数据库配置 =====================
ES_HOST=
ES_USER=
ES_PASSWORD=
ES_INDEX=
# ===================== LLM模型配置 =====================
LLM_API_URL=
LLM_API_KEY=
LLM_API_MODEL=
# ===================== 向量模型配置 =====================
TEXT_EMBEDDING_URL=https://****/v1/embeddings
TEXT_EMBEDDING_API_KEY=
TEXT_EMBEDDING_MODEL=
# ===================== 搜索参数配置 =====================
TOP_K=3 # 默认值3,可根据需求修改
# ===================== pdf解析服务=====================
PDF_PARSE_SERVER=
PDF_PARSE_TYPE=local # local/server 默认值local,server表示使用服务端解析比如调用mineru或deepseek-ocr的接口,需要在pdf_processor.py中适配输出
# 本地部署deepseek-ocr参考https://blog.csdn.net/huanxingchen1/article/details/154193407?spm=1001.2014.3001.55011. 初始化 Elasticsearch
python scripts/init_elasticsearch.py
2. 启动后端服务
cd backend
python main.py
3. 启动前端应用
cd frontend
streamlit run app.py
