В файлах Multimedia_2_6.ipynb, Multimedia_2_7.ipynb, Multimedia_2_8.ipynb лежат выполненные лабораторные работы 6-8 по курсу "Методы, средства и технологии мультимедиа" соответственно. (Файл Multimedia_2_7.ipynb не открывается на preview из-за слишком большого веса, так что для его просмотра необходимо скачивание)
В следующей таблице в ячейках, относящихся к классификации , я буду отображать Accuracy;
в ячейках, относящихся к семантической сегментации , будут указаны метрики IoU и Dice (в скобках);
в ячейках, относящихся к детекции объектов , будут указаны метрики mAP50 и mAP50-95 (в скобках).
Метрика качества на тестовом наборе данных
| Архитектура | Задача | Бейзлайн | Улучшенный бейзлайн | Самостоятельная имплементация алгоритма |
|---|---|---|---|---|
| Сверточные сети | классификация | 0.882 | 0.952 | 0.743 / 0.656* |
| сегментация | 0.6158 (0.7510) |
0.6253 (0.7582) |
0.5900 / 0.5711* (0.7298 / 0.7134*) |
|
| Трансформеры | классификация | 0.946 | 0.985 | 0.184 / 0.185* |
| сегментация | 0.6187 (0.7526) |
0.6316 (0.7637) |
0.5579 / 0.5185* (0.7031 / 0.6667*) |
|
| YOLOv11 | детекция | 0.985 (0.732) |
0.989 (0.749) |
0.2029 / 0.3616* (0.0755 / 0.1429*) |
* — Показания моделеней на улучшенном бейзлайне при собственной имплементации
Хуже всего себя показали собственные имплементации моделей, особенно трансформеров и YOLO. Это можно объяснить как сложностью архитектур, так и недостаточным опытом в их программировании.
Лучше всего себя показали предобученные трансформеры и сверточные сети, особенно в режиме улучшенного бейзлайна. Они продемонстрировали высокую точность как в классификации, так и в сегментации, что говорит об их способности эффективно извлекать признаки даже из сложных данных.
Особо выделился YOLOv11 в задаче детекции: его производительность была очень высока в стандартном и улучшенном режимах, что подтверждает его лидерство среди современных архитектур для решения задач object detection.