Практическая работа по Deep Reinforcement Learning. Целью данной работы является разработка собственных сред обучения и обучение модели в них. Для обучения использован алгоритм Soft Actor-Critic. В качестве инструмента для разработки сред использован игровой движок Unity.
Агент помещается в случайно сгенерированный лабиринт из которого необходимо найти выход.

(Зеленый – выход, синий – агент)
Агент помещается на полке, в случайном месте, в центре которого находится цель. Так же на поле помещаются враги, которые непрерывно двигаются по направлению к агенту. Задача агента – добраться до цели избегая врагов.

(Зеленый – цель, синий – агент, красные - враги)