Shangtong Zhang
|
5fbc1e2e3f
|
Add BaseAgent
|
2018-04-05 22:44:38 -06:00 |
|
Shangtong Zhang
|
549e4af3b8
|
Rewrite PPO
|
2018-04-05 22:32:34 -06:00 |
|
Shangtong Zhang
|
63f8027199
|
Use openai atari wrapper
|
2018-04-03 20:20:18 -06:00 |
|
Shangtong Zhang
|
4fbf811188
|
Quantile Regression DQN cartpole
|
2018-03-21 10:39:00 -06:00 |
|
Shangtong Zhang
|
aa4ec06f2e
|
N-step DQN
|
2018-03-12 22:42:47 -06:00 |
|
Shangtong Zhang
|
3e47451ef6
|
Categorical DQN cart pole
|
2018-03-11 23:54:35 -06:00 |
|
Shangtong Zhang
|
ceaf83bca3
|
Support A2C
|
2018-01-31 16:19:33 -07:00 |
|
Shangtong Zhang
|
71002e4109
|
A single thread DDPG
|
2018-01-01 20:45:15 -07:00 |
|
Shangtong Zhang
|
c1fdb1bd2f
|
Major update
|
2017-11-11 20:52:57 -07:00 |
|
Shangtong Zhang
|
9615195f5e
|
Upgrade to PyTorch v0.2.0
|
2017-10-28 11:06:20 -06:00 |
|
Shangtong Zhang
|
6682937b54
|
Support python3 and pytorch 0.2
|
2017-10-26 23:01:57 -06:00 |
|
Shangtong Zhang
|
8b9fd8d24f
|
Code cleanup
|
2017-10-05 21:42:27 -06:00 |
|
Shangtong Zhang
|
27f54ed420
|
Single thread PPO
|
2017-10-04 09:33:35 -06:00 |
|
Shangtong Zhang
|
d52182882a
|
Implementation of hybrid reward architecture
|
2017-08-29 21:52:26 -06:00 |
|
Shangtong Zhang
|
ce504e2d0f
|
Major refactor
|
2017-07-26 18:18:49 -06:00 |
|