diff --git a/doc/source/rllib-algorithms.rst b/doc/source/rllib-algorithms.rst index 628547a8f..64f2b0eda 100644 --- a/doc/source/rllib-algorithms.rst +++ b/doc/source/rllib-algorithms.rst @@ -213,7 +213,7 @@ Policy Gradients Policy gradients architecture (same as A2C) -Tuned examples: `CartPole-v0 `__ +Tuned examples: `CartPole-v0 `__ **PG-specific configs** (see also `common configs `__): diff --git a/rllib/tuned_examples/regression_tests/cartpole-pg.yaml b/rllib/tuned_examples/regression_tests/cartpole-pg-tf.yaml similarity index 89% rename from rllib/tuned_examples/regression_tests/cartpole-pg.yaml rename to rllib/tuned_examples/regression_tests/cartpole-pg-tf.yaml index 58c29e9e5..016b0b553 100644 --- a/rllib/tuned_examples/regression_tests/cartpole-pg.yaml +++ b/rllib/tuned_examples/regression_tests/cartpole-pg-tf.yaml @@ -1,4 +1,4 @@ -cartpole-pg: +cartpole-pg-tf: env: CartPole-v0 run: PG stop: diff --git a/rllib/tuned_examples/regression_tests/cartpole-pg-torch.yaml b/rllib/tuned_examples/regression_tests/cartpole-pg-torch.yaml new file mode 100644 index 000000000..baaec5660 --- /dev/null +++ b/rllib/tuned_examples/regression_tests/cartpole-pg-torch.yaml @@ -0,0 +1,9 @@ +cartpole-pg-torch: + env: CartPole-v0 + run: PG + stop: + episode_reward_mean: 150 + timesteps_total: 100000 + config: + num_workers: 0 + use_pytorch: true