Разработан в рамках AtomicHack командой "hacken4221".
Live версия доступна тут
Поиск информации по заданной тематике на основе неструктурированных данных (текста).
Поиск информации по заданной тематике на основе структурированных данных (таблицы).
- Движок ассистента разработан на основе LangChain (две векторные бд FAISS для pdf и excel соответсвтенно).
- В качестве LLM используется opensource saiga_llama3_8b, это модель семейства llama3 обученная на русском языке и весящая +- 17 гб GPU
- cointegrated/LaBSE-en-ru используется для получения 'embedding в RAG подходе и в качестве reranker (уточнение контекстных чанков).
- Для чтения pdf используется pytesseract (для изображений) + PyPDF2 (для обычных pdf страниц).
├── app # основная директория проекта
│ ├── utils # содержит утилиты для работы проекта
│ ├── main_app.py # тг бот
│ ├── chat_bot.py # файл ответов на вопросы в формате excel
│ ├── app.ipynb # demo бота с gradio
├── data # содержит данные и БД для проекта, а также тестовые вопросы
├── README.md
├── requirements.txt
└── resources # ресурсы проекта
- Install requirements
pip install -r requirements.txt
- Добавьте config.py -> app
token = 'ваш тг токен'
- Запустите вашего тг бота перейдя в директорию app
python main_app.py
