config/trainer_config.yaml

default:
    trainer: ppo
    batch_size: 1024
    beta: 5.0e-3
    buffer_size: 10240
    epsilon: 0.2
    gamma: 0.99
    hidden_units: 128
    lambd: 0.95
    learning_rate: 3.0e-4
    max_steps: 5.0e4
    memory_size: 256
    normalize: false
    num_epoch: 3
    num_layers: 2
    time_horizon: 64
    sequence_length: 64
    summary_freq: 1000
    use_recurrent: false
    use_curiosity: false
    curiosity_strength: 0.01
    curiosity_enc_size: 128

CCMStackLearning:
    normalize: false
    max_steps: 1.0e7
    time_horizon: 1000
    buffer_size: 491520
    lambd: 0.995
    batch_size: 128
    learning_rate: 5.0e-5
    beta: 1.0e-4
    epsilon: 0.1
    hidden_units: 256
    num_layers: 2
    use_recurrent: false
    sequence_length: 64
    memory_size: 256    

RewardLearning:
    normalize: false
    max_steps: 5.0e6
    time_horizon: 1000
    buffer_size: 30720
    lambd: 0.995
    batch_size: 128
    learning_rate: 5.0e-5
    beta: 1.0e-4
    epsilon: 0.1
    hidden_units: 256
    num_layers: 2

SaverLearning:
    normalize: false
    max_steps: 5.0e5
    time_horizon: 1000
    buffer_size: 30720
    lambd: 0.995
    batch_size: 128
    learning_rate: 1.0e-4
    beta: 1.0e-4
    epsilon: 0.2
    num_layers: 1
    hidden_units: 128
    use_recurrent: false
    sequence_length: 64
    memory_size: 256

SingleSwingLearning:
    normalize: false
    max_steps: 5.0e6
    time_horizon: 1000
    buffer_size: 30720

CBXLearning:
    normalize: true
    max_steps: 2.0e6
    num_layers: 2
    hidden_units: 64
    learning_rate: 5.0e-4

BananaLearning:
    normalize: false
    batch_size: 1024
    beta: 5.0e-3
    buffer_size: 10240
    max_steps: 1.0e5

BouncerLearning:
    normalize: true
    max_steps: 5.0e5
    num_layers: 2
    hidden_units: 64

PushBlockLearning:
    max_steps: 5.0e4
    batch_size: 128
    buffer_size: 2048
    beta: 1.0e-2
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 64
    num_layers: 2

SmallWallJumpLearning: 
    max_steps: 1.0e6
    batch_size: 128
    buffer_size: 2048
    beta: 5.0e-3
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 128
    num_layers: 2
    normalize: false

BigWallJumpLearning: 
    max_steps: 1.0e6
    batch_size: 128
    buffer_size: 2048
    beta: 5.0e-3
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 128
    num_layers: 2
    normalize: false

StrikerLearning:
    max_steps: 5.0e5
    learning_rate: 1e-3
    batch_size: 128
    num_epoch: 3
    buffer_size: 2000
    beta: 1.0e-2
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 128
    num_layers: 2
    normalize: false

GoalieLearning:
    max_steps: 5.0e5
    learning_rate: 1e-3
    batch_size: 320
    num_epoch: 3
    buffer_size: 2000
    beta: 1.0e-2
    hidden_units: 256
    summary_freq: 2000
    time_horizon: 128
    num_layers: 2
    normalize: false

PyramidsLearning:
    use_curiosity: true
    summary_freq: 2000
    curiosity_strength: 0.01
    curiosity_enc_size: 256
    time_horizon: 128
    batch_size: 128
    buffer_size: 2048
    hidden_units: 512
    num_layers: 2
    beta: 1.0e-2
    max_steps: 5.0e5
    num_epoch: 3

VisualPyramidsLearning:
    use_curiosity: true
    curiosity_strength: 0.01
    curiosity_enc_size: 256
    time_horizon: 128
    batch_size: 64
    buffer_size: 2024
    hidden_units: 256
    num_layers: 1
    beta: 1.0e-2
    max_steps: 5.0e5
    num_epoch: 3

3DBallLearning:
    normalize: true
    batch_size: 64
    buffer_size: 12000
    summary_freq: 1000
    time_horizon: 1000
    lambd: 0.99
    gamma: 0.995
    beta: 0.001
    use_curiosity: true

3DBallHardLearning:
    normalize: true
    batch_size: 1200
    buffer_size: 12000
    summary_freq: 1000
    time_horizon: 1000
    max_steps: 5.0e5
    gamma: 0.995
    beta: 0.001

TennisLearning:
    normalize: true
    max_steps: 2e5

CrawlerStaticLearning:
    normalize: true
    num_epoch: 3
    time_horizon: 1000
    batch_size: 2024
    buffer_size: 20240
    gamma: 0.995
    max_steps: 1e6
    summary_freq: 3000
    num_layers: 3
    hidden_units: 512

CrawlerDynamicLearning:
    normalize: true
    num_epoch: 3
    time_horizon: 1000
    batch_size: 2024
    buffer_size: 20240
    gamma: 0.995
    max_steps: 1e6
    summary_freq: 3000
    num_layers: 3
    hidden_units: 512

WalkerLearning:
    normalize: true
    num_epoch: 3
    time_horizon: 1000
    batch_size: 2048
    buffer_size: 20480
    gamma: 0.995
    max_steps: 2e6
    summary_freq: 3000
    num_layers: 3
    hidden_units: 512

ReacherLearning:
    normalize: true
    num_epoch: 3
    time_horizon: 1000
    batch_size: 2024
    buffer_size: 20240
    gamma: 0.995
    max_steps: 1e6
    summary_freq: 3000

HallwayLearning:
    use_recurrent: true
    sequence_length: 64
    num_layers: 2
    hidden_units: 128
    memory_size: 256
    beta: 1.0e-2
    gamma: 0.99
    num_epoch: 3
    buffer_size: 1024
    batch_size: 128
    max_steps: 5.0e5
    summary_freq: 1000
    time_horizon: 64

VisualHallwayLearning:
    use_recurrent: true
    sequence_length: 64
    num_layers: 1
    hidden_units: 128
    memory_size: 256
    beta: 1.0e-2
    gamma: 0.99
    num_epoch: 3
    buffer_size: 1024
    batch_size: 64
    max_steps: 5.0e5
    summary_freq: 1000
    time_horizon: 64

VisualPushBlockLearning:
    use_recurrent: true
    sequence_length: 32
    num_layers: 1
    hidden_units: 128
    memory_size: 256
    beta: 1.0e-2
    gamma: 0.99
    num_epoch: 3
    buffer_size: 1024
    batch_size: 64
    max_steps: 5.0e5
    summary_freq: 1000
    time_horizon: 64

GridWorldLearning:
    batch_size: 32
    normalize: false
    num_layers: 1
    hidden_units: 256
    beta: 5.0e-3
    gamma: 0.9
    buffer_size: 256
    max_steps: 5.0e5
    summary_freq: 2000
    time_horizon: 5

BasicLearning:
    batch_size: 32
    normalize: false
    num_layers: 1
    hidden_units: 20
    beta: 5.0e-3
    gamma: 0.9
    buffer_size: 256
    max_steps: 5.0e5
    summary_freq: 2000
    time_horizon: 3