mirror of
https://github.com/wassname/DeepRL.git
synced 2026-09-09 11:13:47 +08:00
Update README
This commit is contained in:
@@ -7,13 +7,12 @@ Implemented algorithms:
|
||||
* Deep Q-Learning (DQN)
|
||||
* Double DQN
|
||||
* Dueling DQN
|
||||
* Async Advantage Actor Critic (A3C)
|
||||
* (Async) Advantage Actor Critic (A3C / A2C)
|
||||
* Async One-Step Q-Learning
|
||||
* Async One-Step Sarsa
|
||||
* Async N-Step Q-Learning
|
||||
* Continuous A3C
|
||||
* Distributed Deep Deterministic Policy Gradient (Distributed DDPG, aka D3PG)
|
||||
* Hybrid Reward Architecture (HRA)
|
||||
* Parallelized Proximal Policy Optimization (P3O, similar to DPPO)
|
||||
* Action Conditional Video Prediction
|
||||
|
||||
|
||||
+1
-1
@@ -100,7 +100,7 @@ class A2CAgent:
|
||||
value_loss = 0.5 * (Variable(returns) - value).pow(2)
|
||||
|
||||
self.optimizer.zero_grad()
|
||||
(policy_loss + value_loss).mean().backward()
|
||||
(policy_loss + value_loss).sum().backward()
|
||||
nn.utils.clip_grad_norm(self.network.parameters(), config.gradient_clip)
|
||||
self.optimizer.step()
|
||||
|
||||
|
||||
@@ -308,13 +308,14 @@ if __name__ == '__main__':
|
||||
mkdir('data/video')
|
||||
mkdir('log')
|
||||
os.system('export OMP_NUM_THREADS=1')
|
||||
os.system('export CUDA_VISIBLE_DEVICES=0')
|
||||
# logger.setLevel(logging.DEBUG)
|
||||
logger.setLevel(logging.INFO)
|
||||
|
||||
dqn_cart_pole()
|
||||
# dqn_cart_pole()
|
||||
# async_cart_pole()
|
||||
# a3c_cart_pole()
|
||||
# a2c_cart_pole()
|
||||
a2c_cart_pole()
|
||||
# a3c_continuous()
|
||||
# p3o_continuous()
|
||||
# d3pg_continuous()
|
||||
|
||||
Reference in New Issue
Block a user