25 Commits
Author SHA1 Message Date
Shangtong Zhang 8224a41ba9 Update README 2018-01-01 22:49:19 -07:00
Shangtong Zhang b85ec446aa Introduce tensorboardX 2018-01-01 21:52:24 -07:00
Shangtong Zhang 71fa1aaf48 Minor fix 2018-01-01 20:45:56 -07:00
Shangtong Zhang 71002e4109 A single thread DDPG 2018-01-01 20:45:15 -07:00
Shangtong Zhang 964734755f Expose original Atari game reward 2017-12-23 20:52:17 -07:00
Shangtong Zhang 040df4efcf Print pictures 2017-12-19 22:09:35 -07:00
Shangtong Zhang e4c7558726 Update video prediction 2017-12-18 09:28:09 -07:00
Shangtong Zhang 214f7693c2 Generate dataset for video prediction 2017-12-16 20:03:11 -07:00
Shangtong Zhang 56304e63e6 Update logger 2017-12-14 15:12:36 -07:00
Shangtong Zhang c1fdb1bd2f Major update 2017-11-11 20:52:57 -07:00
Shangtong Zhang 9615195f5e Upgrade to PyTorch v0.2.0 2017-10-28 11:06:20 -06:00
Shangtong Zhang a59f2d2911 Benchmark DDPG with Roboschool 2017-10-27 23:09:24 -06:00
Shangtong Zhang 6682937b54 Support python3 and pytorch 0.2 2017-10-26 23:01:57 -06:00
Shangtong Zhang 3ed6f2a9db Log wall time 2017-10-14 16:38:51 -06:00
Shangtong Zhang 51f125c01e Improve normalizer for scalar 2017-10-07 21:23:02 -06:00
Shangtong Zhang fae9a85f31 Major update 2017-10-06 22:10:44 -06:00
Shangtong Zhang c5cbc10f94 Refactor DDPG 2017-10-06 11:16:21 -06:00
Shangtong Zhang 8b9fd8d24f Code cleanup 2017-10-05 21:42:27 -06:00
Shangtong Zhang dd2443c1c3 DPPO 2017-10-05 21:40:42 -06:00
Shangtong Zhang e58938e3fe Support async PPO, which doesn't work 2017-10-04 22:33:26 -06:00
Shangtong Zhang c773da7d08 Support shared stats for continuous A3C 2017-10-04 20:58:42 -06:00
Shangtong Zhang d52182882a Implementation of hybrid reward architecture 2017-08-29 21:52:26 -06:00
Shangtong Zhang 5116733f22 DDPG Pendulum 2017-08-01 10:52:14 -06:00
Shangtong Zhang 1be3b44999 Continuous A3C 2017-07-31 22:53:09 -06:00
Shangtong Zhang ce504e2d0f Major refactor 2017-07-26 18:18:49 -06:00