[RLlib] Allow for more than 2^31 policy timesteps. (#11301)

This commit is contained in:
Sven Mika
2020-10-12 13:49:11 -07:00
committed by GitHub
parent f5e2cda68a
commit 8ea1bc5ff9
11 changed files with 96 additions and 14 deletions
+2 -1
View File
@@ -46,12 +46,13 @@ class RandomEnv(gym.Env):
self.action_space, action))
self.steps += 1
done = False
# We are done as per our max-episode-len.
if self.max_episode_len is not None and \
self.steps >= self.max_episode_len:
done = True
# Max not reached yet -> Sample done via p_done.
else:
elif self.p_done > 0.0:
done = bool(
np.random.choice(
[True, False], p=[self.p_done, 1.0 - self.p_done]))