diff --git a/agent/DDPG_agent.py b/agent/DDPG_agent.py index 24a372e..bd72378 100644 --- a/agent/DDPG_agent.py +++ b/agent/DDPG_agent.py @@ -93,7 +93,7 @@ class DDPGAgent: for key in info: config.logger.scalar_summary('info_' + key, info[key], self.total_steps) - reward = self.reward_normalizer(reward) + reward = self.reward_normalizer(reward) * config.reward_scaling if not deterministic: self.replay.feed([state, action, reward, next_state, int(done)]) diff --git a/utils/config.py b/utils/config.py index 9df817d..fb5ae4d 100644 --- a/utils/config.py +++ b/utils/config.py @@ -49,5 +49,6 @@ class Config: self.min_epsilon = 0 self.save_interval = 0 self.max_steps = 0 + self.reward_scaling = 1 self.success_threshold = float('inf') self.render_episode_freq = 0