diff --git a/.gitignore b/.gitignore new file mode 100644 index 0000000..93cd52f --- /dev/null +++ b/.gitignore @@ -0,0 +1,2 @@ +__pycache__/ +runs/ diff --git a/main.py b/main.py index 85973de..010807b 100644 --- a/main.py +++ b/main.py @@ -49,9 +49,11 @@ args = parser.parse_args() # Environment # env = NormalizedActions(gym.make(args.env_name)) env = gym.make(args.env_name) +env.seed(args.seed) +env.action_space.seed(args.seed) + torch.manual_seed(args.seed) np.random.seed(args.seed) -env.seed(args.seed) # Agent agent = SAC(env.observation_space.shape[0], env.action_space, args) @@ -61,7 +63,7 @@ writer = SummaryWriter('runs/{}_SAC_{}_{}_{}'.format(datetime.datetime.now().str args.policy, "autotune" if args.automatic_entropy_tuning else "")) # Memory -memory = ReplayMemory(args.replay_size) +memory = ReplayMemory(args.replay_size, args.seed) # Training Loop total_numsteps = 0 diff --git a/replay_memory.py b/replay_memory.py index 40de881..5152063 100644 --- a/replay_memory.py +++ b/replay_memory.py @@ -2,7 +2,8 @@ import random import numpy as np class ReplayMemory: - def __init__(self, capacity): + def __init__(self, capacity, seed): + random.seed(seed) self.capacity = capacity self.buffer = [] self.position = 0