ICM+RND 分层新颖信号融合好奇心驱动 PPO 智能体 · 稀疏奖励探索管线(Crafter / Atari Montezuma / MiniGrid)· RTX3060 6GB 显存优化至 ~2.2GB · 144 单元测试 · MIT
python reinforcement-learning deep-reinforcement-learning pytorch exploration icm research-project rnd undergraduate game-ai intrinsic-motivation ppo onnx curiosity-driven sparse-reward ngu vite-react
-
Updated
Jul 20, 2026 - Python