diff --git a/agent/DDPG_agent.py b/agent/DDPG_agent.py index d012be5..aa649b1 100644 --- a/agent/DDPG_agent.py +++ b/agent/DDPG_agent.py @@ -67,8 +67,8 @@ class DDPGAgent: # tensorboard logging suffix = 'test_' if deterministic else '' - config.logger.scalar_summary(suffix+'action', action, self.total_steps) - config.logger.scalar_summary(suffix+'reward', reward, self.total_steps) + config.logger.scalar_summary(suffix + 'action', action, self.total_steps) + config.logger.scalar_summary(suffix + 'reward', reward, self.total_steps) for key in info: config.logger.scalar_summary('info_' + key, info[key], self.total_steps) @@ -125,4 +125,6 @@ class DDPGAgent: self.soft_update(self.target_network, self.worker_network) + config.logger.writer.file_writer.flush() + return total_reward, steps diff --git a/async_worker/dpg.py b/async_worker/dpg.py index eaa9272..8922b43 100644 --- a/async_worker/dpg.py +++ b/async_worker/dpg.py @@ -135,4 +135,6 @@ class DeterministicPolicyGradient: self.shared_reward_normalizer.offline_stats.merge(self.reward_normalizer.online_stats) self.reward_normalizer.online_stats.zero() + config.logger.writer.file_writer.flush() + return steps, total_reward diff --git a/async_worker/ppo.py b/async_worker/ppo.py index 24c003b..f23ab1e 100644 --- a/async_worker/ppo.py +++ b/async_worker/ppo.py @@ -167,4 +167,6 @@ class ProximalPolicyOptimization: self.critic_opt.step() config.total_epochs.value += 1 + config.logger.writer.file_writer.flush() + return batched_steps, batched_rewards