diff --git a/agent/A2C_agent.py b/agent/A2C_agent.py index 3b69cc3..424a147 100644 --- a/agent/A2C_agent.py +++ b/agent/A2C_agent.py @@ -30,7 +30,7 @@ class A2CAgent(BaseAgent): config = self.config rollout = [] states = self.states - for i in range(config.rollout_length): + for _ in range(config.rollout_length): prob, log_prob, value = self.network.predict(config.state_normalizer(states)) actions = [self.policy.sample(p) for p in prob.data.cpu().numpy()] next_states, rewards, terminals, _ = self.task.step(actions) diff --git a/agent/NStepDQN_agent.py b/agent/NStepDQN_agent.py index ceda108..d384174 100644 --- a/agent/NStepDQN_agent.py +++ b/agent/NStepDQN_agent.py @@ -34,7 +34,7 @@ class NStepDQNAgent(BaseAgent): config = self.config rollout = [] states = self.states - for i in range(config.rollout_length): + for _ in range(config.rollout_length): q = self.network.predict(self.config.state_normalizer(states)) actions = [self.policy.sample(v) for v in q.data.cpu().numpy()] next_states, rewards, terminals, _ = self.task.step(actions) diff --git a/agent/PPO_agent.py b/agent/PPO_agent.py index 70c00b1..7df4bbb 100644 --- a/agent/PPO_agent.py +++ b/agent/PPO_agent.py @@ -30,7 +30,7 @@ class PPOAgent(BaseAgent): config = self.config rollout = [] states = self.states - for i in range(config.rollout_length): + for _ in range(config.rollout_length): actions, log_probs, _, values = self.network.predict(states) next_states, rewards, terminals, _ = self.task.step(actions.data.cpu().numpy()) self.episode_rewards += rewards