22 Commits
Author SHA1 Message Date
Shangtong Zhang 9615195f5e Upgrade to PyTorch v0.2.0 2017-10-28 11:06:20 -06:00
Shangtong Zhang a59f2d2911 Benchmark DDPG with Roboschool 2017-10-27 23:09:24 -06:00
Shangtong Zhang 6682937b54 Support python3 and pytorch 0.2 2017-10-26 23:01:57 -06:00
Shangtong Zhang 1b6de16b4f Fix a critical bug in DDPG 2017-10-15 10:05:33 -06:00
Shangtong Zhang 3ed6f2a9db Log wall time 2017-10-14 16:38:51 -06:00
Shangtong Zhang fae9a85f31 Major update 2017-10-06 22:10:44 -06:00
Shangtong Zhang c5cbc10f94 Refactor DDPG 2017-10-06 11:16:21 -06:00
Shangtong Zhang 8b9fd8d24f Code cleanup 2017-10-05 21:42:27 -06:00
Shangtong Zhang dd2443c1c3 DPPO 2017-10-05 21:40:42 -06:00
Shangtong Zhang e58938e3fe Support async PPO, which doesn't work 2017-10-04 22:33:26 -06:00
Shangtong Zhang c773da7d08 Support shared stats for continuous A3C 2017-10-04 20:58:42 -06:00
Shangtong Zhang 3935dfc428 Unifying networks for continuous A3C and PPO 2017-10-04 11:03:02 -06:00
Shangtong Zhang 3adceb5284 Gaussian actor 2017-10-04 10:15:28 -06:00
Shangtong Zhang 27f54ed420 Single thread PPO 2017-10-04 09:33:35 -06:00
Shangtong Zhang e60e9feecb Refactor for HRA 2017-08-29 22:10:13 -06:00
Shangtong Zhang d52182882a Implementation of hybrid reward architecture 2017-08-29 21:52:26 -06:00
Shangtong Zhang 44e8a782af Refactor DQN 2017-08-02 14:55:04 -06:00
Shangtong Zhang b161200f0f Add BN layer 2017-08-02 14:35:51 -06:00
Shangtong Zhang 5116733f22 DDPG Pendulum 2017-08-01 10:52:14 -06:00
Shangtong Zhang 1be3b44999 Continuous A3C 2017-07-31 22:53:09 -06:00
Shangtong Zhang bbfcbf76f4 Major reversion 2017-07-30 13:24:04 -06:00
Shangtong Zhang ce504e2d0f Major refactor 2017-07-26 18:18:49 -06:00