From 7659cae3ba89020f1446c2ede628345e34e6726e Mon Sep 17 00:00:00 2001 From: Sven Mika Date: Sun, 19 Jan 2020 00:57:12 +0100 Subject: [PATCH] [RLlib] Add PG torch regression test (#6828) * Add PG torch regression test to tuned_examples/regression_tests dir. * Rename cartpole-pg.yaml into cartpole-pg-tf.yaml * cartpole-pg-tf.yaml: Change cartpole-pg name of tuned_example to cartpole-pg-tf. --- doc/source/rllib-algorithms.rst | 2 +- .../{cartpole-pg.yaml => cartpole-pg-tf.yaml} | 2 +- .../regression_tests/cartpole-pg-torch.yaml | 9 +++++++++ 3 files changed, 11 insertions(+), 2 deletions(-) rename rllib/tuned_examples/regression_tests/{cartpole-pg.yaml => cartpole-pg-tf.yaml} (89%) create mode 100644 rllib/tuned_examples/regression_tests/cartpole-pg-torch.yaml diff --git a/doc/source/rllib-algorithms.rst b/doc/source/rllib-algorithms.rst index 628547a8f..64f2b0eda 100644 --- a/doc/source/rllib-algorithms.rst +++ b/doc/source/rllib-algorithms.rst @@ -213,7 +213,7 @@ Policy Gradients Policy gradients architecture (same as A2C) -Tuned examples: `CartPole-v0 `__ +Tuned examples: `CartPole-v0 `__ **PG-specific configs** (see also `common configs `__): diff --git a/rllib/tuned_examples/regression_tests/cartpole-pg.yaml b/rllib/tuned_examples/regression_tests/cartpole-pg-tf.yaml similarity index 89% rename from rllib/tuned_examples/regression_tests/cartpole-pg.yaml rename to rllib/tuned_examples/regression_tests/cartpole-pg-tf.yaml index 58c29e9e5..016b0b553 100644 --- a/rllib/tuned_examples/regression_tests/cartpole-pg.yaml +++ b/rllib/tuned_examples/regression_tests/cartpole-pg-tf.yaml @@ -1,4 +1,4 @@ -cartpole-pg: +cartpole-pg-tf: env: CartPole-v0 run: PG stop: diff --git a/rllib/tuned_examples/regression_tests/cartpole-pg-torch.yaml b/rllib/tuned_examples/regression_tests/cartpole-pg-torch.yaml new file mode 100644 index 000000000..baaec5660 --- /dev/null +++ b/rllib/tuned_examples/regression_tests/cartpole-pg-torch.yaml @@ -0,0 +1,9 @@ +cartpole-pg-torch: + env: CartPole-v0 + run: PG + stop: + episode_reward_mean: 150 + timesteps_total: 100000 + config: + num_workers: 0 + use_pytorch: true