diff --git a/.gitignore b/.gitignore new file mode 100644 index 0000000..93cd52f --- /dev/null +++ b/.gitignore @@ -0,0 +1,2 @@ +__pycache__/ +runs/ diff --git a/main.py b/main.py index 2d85171..aa35466 100644 --- a/main.py +++ b/main.py @@ -46,9 +46,11 @@ args = parser.parse_args() # Environment env = gym.make(args.env_name) +env.seed(args.seed) +env.action_space.seed(args.seed) + torch.manual_seed(args.seed) np.random.seed(args.seed) -env.seed(args.seed) # Agent agent = SAC(env.observation_space.shape[0], env.action_space, args) @@ -56,7 +58,7 @@ agent = SAC(env.observation_space.shape[0], env.action_space, args) writer = SummaryWriter('runs/{}_SAC_V_{}'.format(datetime.datetime.now().strftime("%Y-%m-%d_%H-%M-%S"), args.env_name)) # Memory -memory = ReplayMemory(args.replay_size) +memory = ReplayMemory(args.replay_size, args.seed) # Training Loop total_numsteps = 0 diff --git a/replay_memory.py b/replay_memory.py index 40de881..5152063 100644 --- a/replay_memory.py +++ b/replay_memory.py @@ -2,7 +2,8 @@ import random import numpy as np class ReplayMemory: - def __init__(self, capacity): + def __init__(self, capacity, seed): + random.seed(seed) self.capacity = capacity self.buffer = [] self.position = 0