Shangtong Zhang
45587b9cce
Update PPO
2018-04-08 09:14:35 -06:00
Shangtong Zhang
8dfe6ff7c8
Rewrite state/reward normalizer
2018-04-06 11:36:44 -06:00
Shangtong Zhang
4c6481d5be
Tune parameters for DDPG
2018-04-06 10:34:52 -06:00
Shangtong Zhang
549e4af3b8
Rewrite PPO
2018-04-05 22:32:34 -06:00
Shangtong Zhang
8ad31c79b8
Update DDPG
2018-04-04 21:54:26 -06:00
Shangtong Zhang
0b57fdbc70
Rewrite discrete networks
2018-04-04 16:19:40 -06:00
Shangtong Zhang
63f8027199
Use openai atari wrapper
2018-04-03 20:20:18 -06:00
Shangtong Zhang
e7e94d715b
Add keepdim
2018-03-31 21:46:16 -06:00
Shangtong Zhang
0eaba783e8
Minor update
2018-03-24 23:21:58 -06:00
Shangtong Zhang
6863fc9c14
QR DQN Atari
2018-03-21 10:55:59 -06:00
Shangtong Zhang
4fbf811188
Quantile Regression DQN cartpole
2018-03-21 10:39:00 -06:00
Shangtong Zhang
f61908ba2a
Categorical DQN for Atari
2018-03-12 21:03:38 -06:00
Shangtong Zhang
5b4ecd882e
Fix a bug of Categorical DQN
2018-03-12 20:37:12 -06:00
Shangtong Zhang
3e47451ef6
Categorical DQN cart pole
2018-03-11 23:54:35 -06:00
Shangtong Zhang
6de8062702
Code cleanup
2018-02-12 14:27:40 -07:00
Shangtong Zhang
790c8f5cb9
Orthogonal init
2018-02-12 11:58:30 -07:00
Shangtong Zhang
b24593352d
Remove PIL
2018-02-09 16:34:30 -07:00
Shangtong Zhang
e91ec3be45
Specify a gpu for a network
2018-02-03 10:53:14 -07:00
Shangtong Zhang
fef04b6bf6
Deepmind actor-critic net
2018-02-03 09:51:52 -07:00
Shangtong Zhang
049e56e976
Minor update
2018-02-02 15:19:55 -07:00
Shangtong Zhang
ad9189e25a
Code cleanup
2018-01-31 21:00:19 -07:00
Shangtong Zhang
797f80d5ff
Code cleanup
2018-01-31 20:14:33 -07:00
Shangtong Zhang
ceaf83bca3
Support A2C
2018-01-31 16:19:33 -07:00
Shangtong Zhang
63c5d5ea54
Network cleanup
2018-01-19 11:29:05 -07:00
Shangtong Zhang
eb16eeb2a1
Update DDPG
2018-01-19 11:24:32 -07:00
Shangtong Zhang
69b7ea53cc
Minor update for DQN
2017-12-21 22:22:36 -07:00
Shangtong Zhang
13533ab2fe
Set hidden size
2017-12-18 20:09:11 -07:00
Shangtong Zhang
83a4270bb2
Upgrade to PyTorch v0.3
2017-12-11 23:41:16 -07:00
Mike Clark
deab7043fc
add eps to avoid NaN
...
I tracked some NaN's I was getting down to here. It happens when std is a small number, then var is even smaller, and log_density=inf. There are some problems where the agent will learn to use small standard deviations because jittering movements have a high cost, this makes those more stable.
2017-11-04 16:24:54 +08:00
Mike Clark
212ff0bc70
moving epsilon outside softplus
...
I think you intended this to be outside the softplus. The reason is that it should be applied just before the log to avoid `log(0)=inf`.e.g.
- `log(softplus(-1000+1e-5))=log(0)=inf`.
- `log(softplus(-1000)+1e-5)=log(1e-5)!=inf`.
Also this fixes a NaN I had.
2017-11-01 10:52:23 +08:00
Shangtong Zhang
a59f2d2911
Benchmark DDPG with Roboschool
2017-10-27 23:09:24 -06:00
Shangtong Zhang
6682937b54
Support python3 and pytorch 0.2
2017-10-26 23:01:57 -06:00
Shangtong Zhang
1b6de16b4f
Fix a critical bug in DDPG
2017-10-15 10:05:33 -06:00
Shangtong Zhang
3ed6f2a9db
Log wall time
2017-10-14 16:38:51 -06:00
Shangtong Zhang
c5cbc10f94
Refactor DDPG
2017-10-06 11:16:21 -06:00
Shangtong Zhang
c773da7d08
Support shared stats for continuous A3C
2017-10-04 20:58:42 -06:00
Shangtong Zhang
3935dfc428
Unifying networks for continuous A3C and PPO
2017-10-04 11:03:02 -06:00
Shangtong Zhang
3adceb5284
Gaussian actor
2017-10-04 10:15:28 -06:00
Shangtong Zhang
27f54ed420
Single thread PPO
2017-10-04 09:33:35 -06:00
Shangtong Zhang
e60e9feecb
Refactor for HRA
2017-08-29 22:10:13 -06:00
Shangtong Zhang
d52182882a
Implementation of hybrid reward architecture
2017-08-29 21:52:26 -06:00
Shangtong Zhang
b161200f0f
Add BN layer
2017-08-02 14:35:51 -06:00
Shangtong Zhang
5116733f22
DDPG Pendulum
2017-08-01 10:52:14 -06:00
Shangtong Zhang
1be3b44999
Continuous A3C
2017-07-31 22:53:09 -06:00
Shangtong Zhang
ce504e2d0f
Major refactor
2017-07-26 18:18:49 -06:00