Skip to content

DNET_ReinforcementLearning

nishi_74322014 edited this page Aug 3, 2026 · 1 revision

強化学習(Reinforcement Learning)

概要

一般的に、強化学習は、以下の2つのループで良い方策を編み出す。

  1. 状態を観測 → 行動を選択 → 環境から次の状態と報酬を得る(状態⇔行動ループ)
  2. 集めた経験データから価値を評価 → より良い行動を選択する方策を更新(データ収集⇔行動選択ループ)

この2つのループが同時に回ることで、試行錯誤を通じて長期的に報酬を最大化する最適な行動ルールが生まれる。

特徴

  • エージェントが環境との相互作用を通じて学習
  • 報酬を最大化する行動を試行錯誤で発見
  • 遅延報酬:即座ではなく、将来の報酬を考慮した意思決定

主要な構成要素

  • エージェント:学習し行動する主体
  • 環境:エージェントが相互作用する対象
  • 状態(State):環境の現在の状況
  • 行動(Action):エージェントが選択する動作
  • 報酬(Reward):行動の良し悪しを示すフィードバック
  • 方策(Policy):状態から行動への写像ルール
  • 価値関数(Value Function):状態や行動の長期的な価値

詳細

強化学習、深層強化学習がある。

強化学習

価値ベース

状態や行動の価値を学習する手法

  • 多腕バンディット問題

    • 探索と活用のトレードオフを学ぶ基本問題
    • 限られた試行で最も報酬の高い選択肢を見つける
  • 動的計画法

    • 環境のモデルが既知の場合に最適方策を計算
    • ベルマン方程式を反復的に解く
  • モンテカルロ法

    • エピソード完了後に価値を更新
    • モデルフリー、経験から直接学習
  • TD法系

    • TD法(Temporal Difference):時間差分学習の基本
    • Q学習:最適行動価値関数を学習(オフポリシー)
    • SARSA:方策に従った行動価値関数を学習(オンポリシー)

方策ベース

直接、方策そのものを学習する手法

  • 方策勾配法
    • 方策をパラメータ化し、勾配法で最適化
    • 連続行動空間に対応可能

深層強化学習

ニューラルネットワークを用いた強化学習

価値ベース

  • DQN(Deep Q-Network)

    • 深層学習とQ学習を組み合わせ
    • Experience Replay、Target Networkで安定化
    • Atariゲームで人間レベルの性能を達成
  • Double DQN

    • Q値の過大評価を防ぐ改良版
  • Dueling DQN

    • 価値関数とアドバンテージ関数を分離

方策ベース

  • Actor-Critic

    • Actor(方策)とCritic(価値関数)を同時に学習
    • 方策ベースと価値ベースのハイブリッド
  • A3C(Asynchronous Advantage Actor-Critic)

    • 複数のエージェントを並列実行して効率的に学習
    • 非同期更新により安定性向上
  • PPO(Proximal Policy Optimization)

    • 方策更新の安定性を高める制約付き最適化
    • 実装が容易で高性能
  • SAC(Soft Actor-Critic)

    • エントロピー正則化により探索を促進
    • 連続制御タスクで高性能

応用例

  • ゲームAI

    • AlphaGo:囲碁で世界チャンピオンに勝利
    • AlphaStar:StarCraft IIでグランドマスターレベル達成
    • OpenAI Five:Dota 2でプロチームに勝利
  • ロボティクス

    • ロボットアームの制御
    • 二足歩行ロボットの歩行学習
    • 物体把持タスク
  • 自動運転

    • 経路計画
    • 車線維持
    • 障害物回避
  • 最適化問題

    • 資源配分
    • スケジューリング
    • エネルギー管理
  • 金融

    • トレーディング戦略
    • ポートフォリオ最適化

参考

書籍

動画教材

コンテンツ


Tags: 移行, 強化学習, AI, 深層強化学習, DQN

NetDevInfraWiki

マイクロソフト系技術情報 Wiki
Open 棟梁 Wiki

(未着手)

開発基盤部会 Wiki

移行管理: DONETODO

Clone this wiki locally