From 8274147aff4ed9bb6694c5326b0f98f5ed3c5ddf Mon Sep 17 00:00:00 2001 From: Mike Clark Date: Fri, 2 Feb 2018 12:09:57 +0800 Subject: [PATCH] tensorboard logging for ppo reward --- async_worker/ppo.py | 16 ++++++++++++++++ 1 file changed, 16 insertions(+) diff --git a/async_worker/ppo.py b/async_worker/ppo.py index f23ab1e..be33bf9 100644 --- a/async_worker/ppo.py +++ b/async_worker/ppo.py @@ -78,6 +78,22 @@ class ProximalPolicyOptimization: batched_steps += 1 episode_length += 1 + # tensorboard logging + total_steps = config.total_steps.value + batched_steps + suffix = 'test_' if deterministic else '' + if action.squeeze().ndim == 0: + config.logger.scalar_summary(suffix + 'action', action, total_steps) + config.logger.scalar_summary(suffix + 'mean', mean, total_steps) + config.logger.scalar_summary(suffix + 'std', std, total_steps) + else: + config.logger.histo_summary(suffix + 'action', action, total_steps) + config.logger.histo_summary(suffix + 'mean', mean, total_steps) + config.logger.histo_summary(suffix + 'std', std, total_steps) + config.logger.scalar_summary(suffix + 'value', value, total_steps) + config.logger.scalar_summary(suffix + 'reward', reward, total_steps) + for key in info: + config.logger.scalar_summary('info_' + key, info[key], total_steps) + reward = self.reward_normalizer(reward) rewards.append(reward)