Update README

This commit is contained in:
Shangtong Zhang
2018-04-08 09:40:04 -06:00
parent 7b0c434289
commit 2ff8002c69
-1
View File
@@ -82,5 +82,4 @@ Prediction is sampled after 110K iterations, and I only implemented one-step tra
* [Action-Conditional Video Prediction using Deep Networks in Atari Games](https://arxiv.org/abs/1507.08750)
* [A Distributional Perspective on Reinforcement Learning](https://arxiv.org/abs/1707.06887)
* [Distributional Reinforcement Learning with Quantile Regression](https://arxiv.org/abs/1710.10044)
* Some hyper-parameters are from [DeepMind Control Suite](https://arxiv.org/abs/1801.00690), [OpenAI Baselines](https://github.com/openai/baselines) and [Ilya Kostrikov](https://github.com/ikostrikov/pytorch-a2c-ppo-acktr)