config/sac_trainer_config.yaml

default:
    trainer: sac
    batch_size: 128
    buffer_size: 50000
    buffer_init_steps: 0
    hidden_units: 128
    init_entcoef: 1.0
    learning_rate: 3.0e-4
    learning_rate_schedule: constant
    max_steps: 5.0e4
    memory_size: 256
    normalize: false
    num_update: 1
    train_interval: 1
    num_layers: 2
    time_horizon: 64
    sequence_length: 64
    summary_freq: 1000
    tau: 0.005
    use_recurrent: false
    vis_encode_type: simple
    reward_signals:
        extrinsic:
            strength: 1.0
            gamma: 0.99

FoodCollector:
    normalize: false
    batch_size: 256
    buffer_size: 500000
    max_steps: 1.0e5
    init_entcoef: 0.05
    train_interval: 1

Bouncer:
    normalize: true
    max_steps: 5.0e5
    num_layers: 2
    hidden_units: 64
    summary_freq: 1000

PushBlock:
    max_steps: 5.0e4
    init_entcoef: 0.05
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 64
    num_layers: 2

SmallWallJump:
    max_steps: 1.0e6
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 128
    init_entcoef: 0.1
    num_layers: 2
    normalize: false

BigWallJump:
    max_steps: 1.0e6
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 128
    num_layers: 2
    init_entcoef: 0.1
    normalize: false

Striker:
    max_steps: 5.0e5
    learning_rate: 1e-3
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 128
    init_entcoef: 0.1
    num_layers: 2
    normalize: false

Goalie:
    max_steps: 5.0e5
    learning_rate: 1e-3
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 128
    init_entcoef: 0.1
    num_layers: 2
    normalize: false

Pyramids:
    summary_freq: 2000
    time_horizon: 128
    batch_size: 128
    buffer_init_steps: 10000
    buffer_size: 500000
    hidden_units: 256
    num_layers: 2
    init_entcoef: 0.01
    max_steps: 5.0e5
    sequence_length: 16
    tau: 0.01
    use_recurrent: false
    reward_signals:
        extrinsic:
            strength: 2.0
            gamma: 0.99
        gail:
            strength: 0.02
            gamma: 0.99
            encoding_size: 128
            use_actions: true
            demo_path: demos/ExpertPyramid.demo

VisualPyramids:
    time_horizon: 128
    batch_size: 64
    hidden_units: 256
    buffer_init_steps: 1000
    num_layers: 1
    max_steps: 5.0e5
    buffer_size: 500000
    init_entcoef: 0.01
    tau: 0.01
    reward_signals:
        extrinsic:
            strength: 2.0
            gamma: 0.99
        gail:
            strength: 0.02
            gamma: 0.99
            encoding_size: 128
            use_actions: true
            demo_path: demos/ExpertPyramid.demo

3DBall:
    normalize: true
    batch_size: 64
    buffer_size: 12000
    summary_freq: 1000
    time_horizon: 1000
    hidden_units: 64
    init_entcoef: 0.5

3DBallHard:
    normalize: true
    batch_size: 256
    summary_freq: 1000
    time_horizon: 1000

Tennis:
    buffer_size: 500000
    normalize: true
    max_steps: 2e5

CrawlerStatic:
    normalize: true
    time_horizon: 1000
    batch_size: 256
    train_interval: 2
    buffer_size: 500000
    buffer_init_steps: 2000
    max_steps: 5e5
    summary_freq: 3000
    init_entcoef: 1.0
    num_layers: 3
    hidden_units: 512
    reward_signals:
        extrinsic:
            strength: 1.0
            gamma: 0.995

CrawlerDynamic:
    normalize: true
    time_horizon: 1000
    batch_size: 256
    buffer_size: 500000
    summary_freq: 3000
    train_interval: 2
    num_layers: 3
    max_steps: 1e6
    hidden_units: 512
    reward_signals:
        extrinsic:
            strength: 1.0
            gamma: 0.995

Walker:
    normalize: true
    time_horizon: 1000
    batch_size: 256
    buffer_size: 500000
    max_steps: 2e6
    summary_freq: 3000
    num_layers: 4
    train_interval: 2
    hidden_units: 512
    reward_signals:
        extrinsic:
            strength: 1.0
            gamma: 0.995

Reacher:
    normalize: true
    time_horizon: 1000
    batch_size: 128
    buffer_size: 500000
    max_steps: 2e5
    summary_freq: 3000

Hallway:
    sequence_length: 32
    num_layers: 2
    hidden_units: 128
    memory_size: 256
    init_entcoef: 0.1
    max_steps: 5.0e5
    summary_freq: 1000
    time_horizon: 64
    use_recurrent: true

VisualHallway:
    sequence_length: 32
    num_layers: 1
    hidden_units: 128
    memory_size: 256
    gamma: 0.99
    batch_size: 64
    max_steps: 5.0e5
    summary_freq: 1000
    time_horizon: 64
    use_recurrent: true

VisualPushBlock:
    use_recurrent: true
    sequence_length: 32
    num_layers: 1
    hidden_units: 128
    memory_size: 256
    gamma: 0.99
    buffer_size: 1024
    batch_size: 64
    max_steps: 5.0e5
    summary_freq: 1000
    time_horizon: 64

GridWorld:
    batch_size: 128
    normalize: false
    num_layers: 1
    hidden_units: 128
    init_entcoef: 0.5
    buffer_init_steps: 1000
    buffer_size: 50000
    max_steps: 50000
    summary_freq: 2000
    time_horizon: 5
    reward_signals:
        extrinsic:
            strength: 1.0
            gamma: 0.9

Basic:
    batch_size: 64
    normalize: false
    num_layers: 2
    init_entcoef: 0.01
    hidden_units: 20
    max_steps: 5.0e5
    summary_freq: 2000
    time_horizon: 10