Commit Graph
45 Commits
Author SHA1 Message Date
Shangtong Zhang 45587b9cce Update PPO 2018-04-08 09:14:35 -06:00
Shangtong Zhang 8dfe6ff7c8 Rewrite state/reward normalizer 2018-04-06 11:36:44 -06:00
Shangtong Zhang 4c6481d5be Tune parameters for DDPG 2018-04-06 10:34:52 -06:00
Shangtong Zhang 549e4af3b8 Rewrite PPO 2018-04-05 22:32:34 -06:00
Shangtong Zhang 8ad31c79b8 Update DDPG 2018-04-04 21:54:26 -06:00
Shangtong Zhang 0b57fdbc70 Rewrite discrete networks 2018-04-04 16:19:40 -06:00
Shangtong Zhang 63f8027199 Use openai atari wrapper 2018-04-03 20:20:18 -06:00
Shangtong Zhang e7e94d715b Add keepdim 2018-03-31 21:46:16 -06:00
Shangtong Zhang 0eaba783e8 Minor update 2018-03-24 23:21:58 -06:00
Shangtong Zhang 6863fc9c14 QR DQN Atari 2018-03-21 10:55:59 -06:00
Shangtong Zhang 4fbf811188 Quantile Regression DQN cartpole 2018-03-21 10:39:00 -06:00
Shangtong Zhang f61908ba2a Categorical DQN for Atari 2018-03-12 21:03:38 -06:00
Shangtong Zhang 5b4ecd882e Fix a bug of Categorical DQN 2018-03-12 20:37:12 -06:00
Shangtong Zhang 3e47451ef6 Categorical DQN cart pole 2018-03-11 23:54:35 -06:00
Shangtong Zhang 6de8062702 Code cleanup 2018-02-12 14:27:40 -07:00
Shangtong Zhang 790c8f5cb9 Orthogonal init 2018-02-12 11:58:30 -07:00
Shangtong Zhang b24593352d Remove PIL 2018-02-09 16:34:30 -07:00
Shangtong Zhang e91ec3be45 Specify a gpu for a network 2018-02-03 10:53:14 -07:00
Shangtong Zhang fef04b6bf6 Deepmind actor-critic net 2018-02-03 09:51:52 -07:00
Shangtong Zhang 049e56e976 Minor update 2018-02-02 15:19:55 -07:00
Shangtong Zhang ad9189e25a Code cleanup 2018-01-31 21:00:19 -07:00
Shangtong Zhang 797f80d5ff Code cleanup 2018-01-31 20:14:33 -07:00
Shangtong Zhang ceaf83bca3 Support A2C 2018-01-31 16:19:33 -07:00
Shangtong Zhang 63c5d5ea54 Network cleanup 2018-01-19 11:29:05 -07:00
Shangtong Zhang eb16eeb2a1 Update DDPG 2018-01-19 11:24:32 -07:00
Shangtong Zhang 69b7ea53cc Minor update for DQN 2017-12-21 22:22:36 -07:00
Shangtong Zhang 13533ab2fe Set hidden size 2017-12-18 20:09:11 -07:00
Shangtong Zhang 83a4270bb2 Upgrade to PyTorch v0.3 2017-12-11 23:41:16 -07:00
Mike Clark deab7043fc add eps to avoid NaN
I tracked some NaN's I was getting down to here. It happens when std is a small number, then var is even smaller, and log_density=inf. There are some problems where the agent will learn to use small standard deviations because jittering movements have a high cost, this makes those more stable.
2017-11-04 16:24:54 +08:00
Mike Clark 212ff0bc70 moving epsilon outside softplus
I think you intended this to be outside the softplus. The reason is that it should be applied just before the log to avoid `log(0)=inf`.e.g.

- `log(softplus(-1000+1e-5))=log(0)=inf`. 
- `log(softplus(-1000)+1e-5)=log(1e-5)!=inf`. 

Also this fixes a NaN I had.
2017-11-01 10:52:23 +08:00
Shangtong Zhang a59f2d2911 Benchmark DDPG with Roboschool 2017-10-27 23:09:24 -06:00
Shangtong Zhang 6682937b54 Support python3 and pytorch 0.2 2017-10-26 23:01:57 -06:00
Shangtong Zhang 1b6de16b4f Fix a critical bug in DDPG 2017-10-15 10:05:33 -06:00
Shangtong Zhang 3ed6f2a9db Log wall time 2017-10-14 16:38:51 -06:00
Shangtong Zhang c5cbc10f94 Refactor DDPG 2017-10-06 11:16:21 -06:00
Shangtong Zhang c773da7d08 Support shared stats for continuous A3C 2017-10-04 20:58:42 -06:00
Shangtong Zhang 3935dfc428 Unifying networks for continuous A3C and PPO 2017-10-04 11:03:02 -06:00
Shangtong Zhang 3adceb5284 Gaussian actor 2017-10-04 10:15:28 -06:00
Shangtong Zhang 27f54ed420 Single thread PPO 2017-10-04 09:33:35 -06:00
Shangtong Zhang e60e9feecb Refactor for HRA 2017-08-29 22:10:13 -06:00
Shangtong Zhang d52182882a Implementation of hybrid reward architecture 2017-08-29 21:52:26 -06:00
Shangtong Zhang b161200f0f Add BN layer 2017-08-02 14:35:51 -06:00
Shangtong Zhang 5116733f22 DDPG Pendulum 2017-08-01 10:52:14 -06:00
Shangtong Zhang 1be3b44999 Continuous A3C 2017-07-31 22:53:09 -06:00
Shangtong Zhang ce504e2d0f Major refactor 2017-07-26 18:18:49 -06:00