mirror of
https://github.com/wassname/DeepRL.git
synced 2026-09-09 11:13:47 +08:00
This helps me avoid NaN when I have small rewards
This commit is contained in:
+1
-1
@@ -61,7 +61,7 @@ class DDPGAgent:
|
||||
done = (done or (config.max_episode_length and steps >= config.max_episode_length))
|
||||
next_state = self.state_normalizer(next_state)
|
||||
total_reward += reward
|
||||
# reward = self.reward_normalizer(reward)
|
||||
reward = self.reward_normalizer(reward)
|
||||
|
||||
if not deterministic:
|
||||
self.replay.feed([state, action, reward, next_state, int(done)])
|
||||
|
||||
Reference in New Issue
Block a user