This helps me avoid NaN when I have small rewards

This commit is contained in:
wassname
2017-11-01 18:58:03 +08:00
parent 9ef309696f
commit 662c0834f6
+1 -1
View File
@@ -61,7 +61,7 @@ class DDPGAgent:
done = (done or (config.max_episode_length and steps >= config.max_episode_length))
next_state = self.state_normalizer(next_state)
total_reward += reward
# reward = self.reward_normalizer(reward)
reward = self.reward_normalizer(reward)
if not deterministic:
self.replay.feed([state, action, reward, next_state, int(done)])