Commit Graph
40 Commits
Author SHA1 Message Date
Shangtong Zhang f2db4e8819 Support gym robotics 2018-04-24 21:49:25 -06:00
Shangtong Zhang 92f0366175 Refactor replay 2018-04-21 11:21:48 -06:00
Shangtong Zhang af1cc11669 Update ACVP 2018-04-10 11:25:59 -06:00
Shangtong Zhang 0f3f49252b Support DM Control 2018-04-07 20:53:29 -06:00
Shangtong Zhang 8623fe849b Regenerate images 2018-04-07 10:11:33 -06:00
Shangtong Zhang 8dfe6ff7c8 Rewrite state/reward normalizer 2018-04-06 11:36:44 -06:00
Shangtong Zhang 549e4af3b8 Rewrite PPO 2018-04-05 22:32:34 -06:00
Shangtong Zhang 8ad31c79b8 Update DDPG 2018-04-04 21:54:26 -06:00
Shangtong Zhang 61a4bcce17 Rewrite log system 2018-04-04 20:44:08 -06:00
Shangtong Zhang 63f8027199 Use openai atari wrapper 2018-04-03 20:20:18 -06:00
Shangtong Zhang e427e8f73f Add baselines' plotter 2018-04-02 15:22:56 -06:00
Shangtong Zhang a907dac0bb Ram Atari 2018-02-19 13:55:57 -07:00
Shangtong Zhang 6de8062702 Code cleanup 2018-02-12 14:27:40 -07:00
Shangtong Zhang 790c8f5cb9 Orthogonal init 2018-02-12 11:58:30 -07:00
Shangtong Zhang d4aa8d4a22 Update for latest gym 2018-02-09 22:02:58 -07:00
Shangtong Zhang b24593352d Remove PIL 2018-02-09 16:34:30 -07:00
Shangtong Zhang e91ec3be45 Specify a gpu for a network 2018-02-03 10:53:14 -07:00
Shangtong Zhang e7a568598d Stack frame wrapper 2018-02-02 23:55:14 -07:00
Shangtong Zhang bf4ac20847 Merge pull request #22 from wassname/patch-5
load and save for SharedReplay
2018-02-02 15:23:00 -07:00
Mike Clark 9b7d21a0f2 load and save for SharedReplay
Not sure if your interested in adding this, it just supports saving and loading SharedReplay. For example if you want to load previous DDPG experience.
2018-02-02 15:11:44 +08:00
Shangtong Zhang ad9189e25a Code cleanup 2018-01-31 21:00:19 -07:00
Shangtong Zhang 797f80d5ff Code cleanup 2018-01-31 20:14:33 -07:00
Shangtong Zhang ceaf83bca3 Support A2C 2018-01-31 16:19:33 -07:00
Shangtong Zhang 964734755f Expose original Atari game reward 2017-12-23 20:52:17 -07:00
Shangtong Zhang 214f7693c2 Generate dataset for video prediction 2017-12-16 20:03:11 -07:00
Shangtong Zhang 8c197e183c Support D3PG 2017-11-11 19:41:52 -07:00
Shangtong Zhang edc4e89b9b Update DDPG 2017-11-11 15:27:06 -07:00
Shangtong Zhang 41627588fb Action dim 2017-11-09 16:38:42 -07:00
Shangtong Zhang a59f2d2911 Benchmark DDPG with Roboschool 2017-10-27 23:09:24 -06:00
Shangtong Zhang af360bb9ea Support roboschool 2017-10-27 14:23:54 -06:00
Shangtong Zhang 6682937b54 Support python3 and pytorch 0.2 2017-10-26 23:01:57 -06:00
Shangtong Zhang 1b6de16b4f Fix a critical bug in DDPG 2017-10-15 10:05:33 -06:00
Shangtong Zhang c5cbc10f94 Refactor DDPG 2017-10-06 11:16:21 -06:00
Shangtong Zhang e58938e3fe Support async PPO, which doesn't work 2017-10-04 22:33:26 -06:00
Shangtong Zhang 27f54ed420 Single thread PPO 2017-10-04 09:33:35 -06:00
Shangtong Zhang e60e9feecb Refactor for HRA 2017-08-29 22:10:13 -06:00
Shangtong Zhang d52182882a Implementation of hybrid reward architecture 2017-08-29 21:52:26 -06:00
Shangtong Zhang 5116733f22 DDPG Pendulum 2017-08-01 10:52:14 -06:00
Shangtong Zhang 1be3b44999 Continuous A3C 2017-07-31 22:53:09 -06:00
Shangtong Zhang ce504e2d0f Major refactor 2017-07-26 18:18:49 -06:00