Deep learning sitting posture detection (SPD) based on multimodal datasets
基于Mediapipe骨骼提取与YOLOV11-MSCA改进模型的人体坐姿检测系统 (MY-PDS)
Sitting posture detection system based on Mediapipe bone extraction and YOLOV11-MSCA model
本项目旨在通过深度学习技术搭建一个智能坐姿检测系统。利用Mediapipe和改进后的YOLOV11-MSCA模型,系统能够实时监测用户坐姿并提供及时反馈。项目将通过骨骼架构提取和多尺度通道注意力机制提升坐姿检测的精度与鲁棒性,结合多模态数据集,确保系统在多种环境下高效运行。同时,还计划加入语音提示、个性化健康建议等创新功能,以提升用户的交互体验和健康意识。
- 用户坐姿多分类:用户坐姿多分类:支持 6 类坐姿检测与分类,具体类别如下:

- 实时坐姿检测:基于Mediapipe骨骼提取和YOLOv11-MSCA模型进行实时坐姿检测。
- 精准错误坐姿识别:高效识别常见的错误坐姿,如前倾、侧倾等,并提供实时反馈。
- 多模态数据支持:融合不同场景(教室、车内、办公室等)的多模态数据集,提升模型的泛化能力。
- 健康情况统计:根据视频或图片生成坐姿分析结果表,后续可生成用户专属健康报告与改进建议。
- 创新的人体骨骼提取与检测流程:结合Mediapipe骨骼提取与YOLOV11-MSCA模型,去除背景与干扰,提升模型鲁棒性,尤其在复杂环境中。
- 改进的YOLOv11-MSCA模型:在YOLOv11基础上,集成了多尺度通道注意力(MSCA)机制,优化检测精度与计算效率。
- 多模态数据集支持:支持多场景数据集(教室、车内、办公室等),提高模型的适用性与稳定性。
- 实时性与高效性:优化后的YOLOV11-MSCA模型,具备高效推理速度,适合边缘设备与嵌入式平台实时部署。
- 多种输入源支持:支持从图片、视频、摄像头、文件夹(批量)和网络摄像头等多种输入源进行目标检测,满足不同场景下的使用需求。
- 精美的GUI设计:直观友好的图形用户界面,提供流畅的交互体验与自定义功能。
- Python>=3.8
- PyTorch
- OpenCV
- YOLOv11
- TensorFlow (若使用AR功能)
- 其他依赖:可以通过以下命令安装依赖项:
pip install -r requirements.txtgit clone https://github.com/dinosaurerer/spd.git
cd spd/GUI根据你所使用的操作系统,选择合适的启动方式:
在 Windows 上,你可以直接双击 run.bat 文件来启动坐姿检测系统,或者在命令行中执行以下命令:
在 Linux 或 macOS 上,你需要使用 run.sh 脚本来启动坐姿检测系统。首先,确保你有执行权限:
chmod +x run.sh然后运行 run.sh 脚本:
./run.sh如果你不想使用脚本,可以直接通过命令行运行 Python 脚本:
python main.pyspd/
├── GUI/ # 图形用户界面模块
│ ├── gui.py # 启动脚本,坐姿检测系统的主入口
│ ├── run.sh # Linux/macOS 启动脚本
│ ├── run.bat # Windows 启动脚本
│ └── ... # 其他GUI相关文件
├── YOLO/ # YOLOV11-MSCA模型相关文件
│ ├── train.py # YOLO模型训练脚本
│ ├── config.yaml # 模型配置文件
│ ├── datasetst/MSD # 数据集
│ ├── ultralytics/ # 更改MSCA模型结构
│ └── ... # 其他YOLO相关内容
├── demo_video/ # 演示视频存放目录
├── pngs/ # 模型效果展示图片存放目录
│ ├── result1.png
│ ├── result2.png
│ └── ...
├── process_data/ # 数据处理相关文件
├── LICENSE # 项目许可证
├── README.md # 项目说明文档
└── requirements.txt # Python依赖项清单
欢迎大家为项目做出贡献!如果你有好的功能建议、bug修复或优化方案,请提起一个 Pull Request 或 Issue。
本项目采用 MIT License。
感谢开源社区提供的 MediaPipe 和 YOLOv8 模型,它们为本项目的实施提供了很大的帮助。 感谢团队合作者杨刘军和邹杰对项目的巨大贡献,也感谢所有关注和支持本项目的用户! 本项目灵感来自于人工智能领域的坐姿矫正技术研究,旨在提升用户的健康坐姿意识。 更多细节将会随着项目的迭代更新,感谢您的关注与支持!
- 数据集部分被详细列出,并展示了数据集结构。
- 数据集当前已在kaggle开源:
- kaggle直链下载
- kagglehub 下载
import kagglehub # Download latest version path = kagglehub.dataset_download("xiaokonglong80/spd-yolo") print("Path to dataset files:", path)
- YOLOV11-MSCA模型的kagglehub 下载:
import kagglehub # Download latest version path = kagglehub.model_download("xiaokonglong80/yolov11-msca/pyTorch/default") print("Path to model files:", path)
- 数据集当前已在kaggle开源:




