Mike Clark
|
cb043a44dc
|
read only
|
2018-11-29 07:02:01 +08:00 |
|
Mike C
|
187069b486
|
reward_scaling
|
2018-02-02 16:48:05 +08:00 |
|
Mike C
|
6a92f52b4f
|
save normalizer and replay with ddpg agent
|
2018-01-22 10:48:19 +08:00 |
|
Shangtong Zhang
|
8224a41ba9
|
Update README
|
2018-01-01 22:49:19 -07:00 |
|
Shangtong Zhang
|
b85ec446aa
|
Introduce tensorboardX
|
2018-01-01 21:52:24 -07:00 |
|
Shangtong Zhang
|
71fa1aaf48
|
Minor fix
|
2018-01-01 20:45:56 -07:00 |
|
Shangtong Zhang
|
71002e4109
|
A single thread DDPG
|
2018-01-01 20:45:15 -07:00 |
|
Shangtong Zhang
|
964734755f
|
Expose original Atari game reward
|
2017-12-23 20:52:17 -07:00 |
|
Shangtong Zhang
|
040df4efcf
|
Print pictures
|
2017-12-19 22:09:35 -07:00 |
|
Shangtong Zhang
|
e4c7558726
|
Update video prediction
|
2017-12-18 09:28:09 -07:00 |
|
Shangtong Zhang
|
214f7693c2
|
Generate dataset for video prediction
|
2017-12-16 20:03:11 -07:00 |
|
Shangtong Zhang
|
56304e63e6
|
Update logger
|
2017-12-14 15:12:36 -07:00 |
|
Shangtong Zhang
|
c1fdb1bd2f
|
Major update
|
2017-11-11 20:52:57 -07:00 |
|
Shangtong Zhang
|
9615195f5e
|
Upgrade to PyTorch v0.2.0
|
2017-10-28 11:06:20 -06:00 |
|
Shangtong Zhang
|
a59f2d2911
|
Benchmark DDPG with Roboschool
|
2017-10-27 23:09:24 -06:00 |
|
Shangtong Zhang
|
6682937b54
|
Support python3 and pytorch 0.2
|
2017-10-26 23:01:57 -06:00 |
|
Shangtong Zhang
|
3ed6f2a9db
|
Log wall time
|
2017-10-14 16:38:51 -06:00 |
|
Shangtong Zhang
|
51f125c01e
|
Improve normalizer for scalar
|
2017-10-07 21:23:02 -06:00 |
|
Shangtong Zhang
|
fae9a85f31
|
Major update
|
2017-10-06 22:10:44 -06:00 |
|
Shangtong Zhang
|
c5cbc10f94
|
Refactor DDPG
|
2017-10-06 11:16:21 -06:00 |
|
Shangtong Zhang
|
8b9fd8d24f
|
Code cleanup
|
2017-10-05 21:42:27 -06:00 |
|
Shangtong Zhang
|
dd2443c1c3
|
DPPO
|
2017-10-05 21:40:42 -06:00 |
|
Shangtong Zhang
|
e58938e3fe
|
Support async PPO, which doesn't work
|
2017-10-04 22:33:26 -06:00 |
|
Shangtong Zhang
|
c773da7d08
|
Support shared stats for continuous A3C
|
2017-10-04 20:58:42 -06:00 |
|
Shangtong Zhang
|
d52182882a
|
Implementation of hybrid reward architecture
|
2017-08-29 21:52:26 -06:00 |
|
Shangtong Zhang
|
5116733f22
|
DDPG Pendulum
|
2017-08-01 10:52:14 -06:00 |
|
Shangtong Zhang
|
1be3b44999
|
Continuous A3C
|
2017-07-31 22:53:09 -06:00 |
|
Shangtong Zhang
|
ce504e2d0f
|
Major refactor
|
2017-07-26 18:18:49 -06:00 |
|