From 106ff128735b4ffe213a159e31940a3ce3bdb97b Mon Sep 17 00:00:00 2001 From: Mike C Date: Mon, 22 Jan 2018 10:16:55 +0800 Subject: [PATCH] flush logger --- agent/DDPG_agent.py | 6 ++++-- async_worker/dpg.py | 2 ++ async_worker/ppo.py | 2 ++ 3 files changed, 8 insertions(+), 2 deletions(-) diff --git a/agent/DDPG_agent.py b/agent/DDPG_agent.py index d012be5..aa649b1 100644 --- a/agent/DDPG_agent.py +++ b/agent/DDPG_agent.py @@ -67,8 +67,8 @@ class DDPGAgent: # tensorboard logging suffix = 'test_' if deterministic else '' - config.logger.scalar_summary(suffix+'action', action, self.total_steps) - config.logger.scalar_summary(suffix+'reward', reward, self.total_steps) + config.logger.scalar_summary(suffix + 'action', action, self.total_steps) + config.logger.scalar_summary(suffix + 'reward', reward, self.total_steps) for key in info: config.logger.scalar_summary('info_' + key, info[key], self.total_steps) @@ -125,4 +125,6 @@ class DDPGAgent: self.soft_update(self.target_network, self.worker_network) + config.logger.writer.file_writer.flush() + return total_reward, steps diff --git a/async_worker/dpg.py b/async_worker/dpg.py index eaa9272..8922b43 100644 --- a/async_worker/dpg.py +++ b/async_worker/dpg.py @@ -135,4 +135,6 @@ class DeterministicPolicyGradient: self.shared_reward_normalizer.offline_stats.merge(self.reward_normalizer.online_stats) self.reward_normalizer.online_stats.zero() + config.logger.writer.file_writer.flush() + return steps, total_reward diff --git a/async_worker/ppo.py b/async_worker/ppo.py index 24c003b..f23ab1e 100644 --- a/async_worker/ppo.py +++ b/async_worker/ppo.py @@ -167,4 +167,6 @@ class ProximalPolicyOptimization: self.critic_opt.step() config.total_epochs.value += 1 + config.logger.writer.file_writer.flush() + return batched_steps, batched_rewards