-
Notifications
You must be signed in to change notification settings - Fork 0
DNET_ReinforcementLearning
nishi_74322014 edited this page Aug 3, 2026
·
1 revision
- TOP > BI / AI > 人工知能(AI)
- 戻る(人工知能(AI))
- 機械学習(machine learning)
- 深層学習(deep learning)
- 強化学習(Reinforcement Learning)
- 生成系AI(Generative AI)
一般的に、強化学習は、以下の2つのループで良い方策を編み出す。
- 状態を観測 → 行動を選択 → 環境から次の状態と報酬を得る(状態⇔行動ループ)
- 集めた経験データから価値を評価 → より良い行動を選択する方策を更新(データ収集⇔行動選択ループ)
この2つのループが同時に回ることで、試行錯誤を通じて長期的に報酬を最大化する最適な行動ルールが生まれる。
- エージェントが環境との相互作用を通じて学習
- 報酬を最大化する行動を試行錯誤で発見
- 遅延報酬:即座ではなく、将来の報酬を考慮した意思決定
- エージェント:学習し行動する主体
- 環境:エージェントが相互作用する対象
- 状態(State):環境の現在の状況
- 行動(Action):エージェントが選択する動作
- 報酬(Reward):行動の良し悪しを示すフィードバック
- 方策(Policy):状態から行動への写像ルール
- 価値関数(Value Function):状態や行動の長期的な価値
強化学習、深層強化学習がある。
状態や行動の価値を学習する手法
-
多腕バンディット問題
- 探索と活用のトレードオフを学ぶ基本問題
- 限られた試行で最も報酬の高い選択肢を見つける
-
動的計画法
- 環境のモデルが既知の場合に最適方策を計算
- ベルマン方程式を反復的に解く
-
モンテカルロ法
- エピソード完了後に価値を更新
- モデルフリー、経験から直接学習
-
TD法系
- TD法(Temporal Difference):時間差分学習の基本
- Q学習:最適行動価値関数を学習(オフポリシー)
- SARSA:方策に従った行動価値関数を学習(オンポリシー)
直接、方策そのものを学習する手法
-
方策勾配法
- 方策をパラメータ化し、勾配法で最適化
- 連続行動空間に対応可能
ニューラルネットワークを用いた強化学習
-
DQN(Deep Q-Network)
- 深層学習とQ学習を組み合わせ
- Experience Replay、Target Networkで安定化
- Atariゲームで人間レベルの性能を達成
-
Double DQN
- Q値の過大評価を防ぐ改良版
-
Dueling DQN
- 価値関数とアドバンテージ関数を分離
-
Actor-Critic
- Actor(方策)とCritic(価値関数)を同時に学習
- 方策ベースと価値ベースのハイブリッド
-
A3C(Asynchronous Advantage Actor-Critic)
- 複数のエージェントを並列実行して効率的に学習
- 非同期更新により安定性向上
-
PPO(Proximal Policy Optimization)
- 方策更新の安定性を高める制約付き最適化
- 実装が容易で高性能
-
SAC(Soft Actor-Critic)
- エントロピー正則化により探索を促進
- 連続制御タスクで高性能
-
ゲームAI
- AlphaGo:囲碁で世界チャンピオンに勝利
- AlphaStar:StarCraft IIでグランドマスターレベル達成
- OpenAI Five:Dota 2でプロチームに勝利
-
ロボティクス
- ロボットアームの制御
- 二足歩行ロボットの歩行学習
- 物体把持タスク
-
自動運転
- 経路計画
- 車線維持
- 障害物回避
-
最適化問題
- 資源配分
- スケジューリング
- エネルギー管理
-
金融
- トレーディング戦略
- ポートフォリオ最適化
- ゼロから作るDeep Learning - 強化学習編
-
AIcia Solid Project
-
データサイエンス研究所
- OSSコンソーシアム コンテンツ:https://www.osscons.jp/joy1y64w3-537
- 深層学習についてのレポート(強化学習、深層強化学習)
- 機械学習・深層学習についてのNotebook:https://github.com/OpenTouryoProject/DxCommon/tree/master/Notebook/path
Tags: 移行, 強化学習, AI, 深層強化学習, DQN
このWikiは「Open棟梁Project」,「OSSコンソーシアム 開発基盤部会」によって運営されています。