From 662c0834f6638ef8d915c5d26f71c8bc4325fc42 Mon Sep 17 00:00:00 2001 From: wassname Date: Wed, 1 Nov 2017 18:58:03 +0800 Subject: [PATCH] This helps me avoid NaN when I have small rewards --- agent/DDPG_agent.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/agent/DDPG_agent.py b/agent/DDPG_agent.py index 2c71050..600c334 100644 --- a/agent/DDPG_agent.py +++ b/agent/DDPG_agent.py @@ -61,7 +61,7 @@ class DDPGAgent: done = (done or (config.max_episode_length and steps >= config.max_episode_length)) next_state = self.state_normalizer(next_state) total_reward += reward - # reward = self.reward_normalizer(reward) + reward = self.reward_normalizer(reward) if not deterministic: self.replay.feed([state, action, reward, next_state, int(done)])