Commit Graph
136 Commits
Author SHA1 Message Date
Shangtong Zhang fef04b6bf6 Deepmind actor-critic net 2018-02-03 09:51:52 -07:00
Shangtong Zhang e7a568598d Stack frame wrapper 2018-02-02 23:55:14 -07:00
Shangtong Zhang 8bf3a81f63 Minor update 2018-02-02 15:26:21 -07:00
Shangtong Zhang bf4ac20847 Merge pull request #22 from wassname/patch-5
load and save for SharedReplay
2018-02-02 15:23:00 -07:00
Shangtong Zhang 9896736809 Merge pull request #23 from wassname/patch-6
load_state_dict for Normalizer, StaticNormalizer
2018-02-02 15:21:35 -07:00
Shangtong Zhang 049e56e976 Minor update 2018-02-02 15:19:55 -07:00
Mike Clark db94825b19 load_state_dict for Normalizer, StaticNormalizer 2018-02-02 15:14:49 +08:00
Mike Clark 9b7d21a0f2 load and save for SharedReplay
Not sure if your interested in adding this, it just supports saving and loading SharedReplay. For example if you want to load previous DDPG experience.
2018-02-02 15:11:44 +08:00
Shangtong Zhang ad9189e25a Code cleanup 2018-01-31 21:00:19 -07:00
Shangtong Zhang 3dcda7b5d5 Update README 2018-01-31 20:21:38 -07:00
Shangtong Zhang 797f80d5ff Code cleanup 2018-01-31 20:14:33 -07:00
Shangtong Zhang ceaf83bca3 Support A2C 2018-01-31 16:19:33 -07:00
Shangtong Zhang 63c5d5ea54 Network cleanup 2018-01-19 11:29:05 -07:00
Shangtong Zhang eb16eeb2a1 Update DDPG 2018-01-19 11:24:32 -07:00
Shangtong Zhang db49a76c53 Fix a minor issue in the async demon 2018-01-17 10:43:16 -07:00
Shangtong Zhang 8224a41ba9 Update README 2018-01-01 22:49:19 -07:00
Shangtong Zhang b85ec446aa Introduce tensorboardX 2018-01-01 21:52:24 -07:00
Shangtong Zhang 71fa1aaf48 Minor fix 2018-01-01 20:45:56 -07:00
Shangtong Zhang 71002e4109 A single thread DDPG 2018-01-01 20:45:15 -07:00
Shangtong Zhang 0b075a353b Reseed for each worker 2017-12-25 09:52:38 -07:00
Shangtong Zhang 964734755f Expose original Atari game reward 2017-12-23 20:52:17 -07:00
Shangtong Zhang 69b7ea53cc Minor update for DQN 2017-12-21 22:22:36 -07:00
Shangtong Zhang 8839614c44 Minor fix for python3 2017-12-20 11:40:06 -07:00
Shangtong Zhang 7a97c742cf Update README 2017-12-20 09:40:03 -07:00
Shangtong Zhang 1b9acb17f0 Complete ACVP 2017-12-20 09:36:37 -07:00
Shangtong Zhang 040df4efcf Print pictures 2017-12-19 22:09:35 -07:00
Shangtong Zhang 13533ab2fe Set hidden size 2017-12-18 20:09:11 -07:00
Shangtong Zhang e4c7558726 Update video prediction 2017-12-18 09:28:09 -07:00
Shangtong Zhang f0940e86dc Setup 1-step prediction 2017-12-16 22:14:40 -07:00
Shangtong Zhang 214f7693c2 Generate dataset for video prediction 2017-12-16 20:03:11 -07:00
Shangtong Zhang 56304e63e6 Update logger 2017-12-14 15:12:36 -07:00
Shangtong Zhang fed4bd5163 Update async methods 2017-12-12 10:39:16 -07:00
Shangtong Zhang 83a4270bb2 Upgrade to PyTorch v0.3 2017-12-11 23:41:16 -07:00
Shangtong Zhang 4697d1d3e9 Remove unnecessary conversion 2017-11-14 19:14:42 -07:00
Shangtong Zhang 65eea71bdb Merge branch 'wassname-master' 2017-11-14 19:12:44 -07:00
wassname e16a560abc let ppo work with gpu 2017-11-15 09:40:58 +08:00
wassname aec67c66f8 Merge branch 'master' of https://github.com/ShangtongZhang/DeepRL 2017-11-15 09:38:53 +08:00
Shangtong Zhang d47bb7a59a Update README 2017-11-11 21:05:03 -07:00
Shangtong Zhang 0fb70fa484 Minor fix 2017-11-11 20:58:18 -07:00
Shangtong Zhang c1fdb1bd2f Major update 2017-11-11 20:52:57 -07:00
Shangtong Zhang 8c197e183c Support D3PG 2017-11-11 19:41:52 -07:00
Shangtong Zhang edc4e89b9b Update DDPG 2017-11-11 15:27:06 -07:00
Shangtong Zhang 41627588fb Action dim 2017-11-09 16:38:42 -07:00
Shangtong Zhang e1e6446728 Minor update 2017-11-09 08:50:57 -07:00
Shangtong Zhang 347d0d22cb Fix a bug 2017-11-05 18:58:14 -07:00
Shangtong Zhang 34c6ca7dd8 Update figures 2017-11-05 00:07:38 -06:00
Shangtong Zhang 29c6ce7266 Update figures 2017-11-05 00:07:07 -06:00
Shangtong Zhang 736825a383 Update README 2017-11-05 00:02:15 -06:00
Shangtong Zhang cc1e1415c7 Merge pull request #5 from wassname/patch-2
add eps to log_density to avoid NaN
2017-11-04 09:13:29 -06:00
Mike Clark deab7043fc add eps to avoid NaN
I tracked some NaN's I was getting down to here. It happens when std is a small number, then var is even smaller, and log_density=inf. There are some problems where the agent will learn to use small standard deviations because jittering movements have a high cost, this makes those more stable.
2017-11-04 16:24:54 +08:00