这是一个学习强化学习产生的代码 我实现DQN,PG等算法 ## DQN 包含两个算法 ## Policy Gradient 使用下面的命令可以运行已经保存好的模型 ``` python Run_Model.py ``` 使用下面的命令开始训练 ``` pytorch_MountainCar-v0.py ``` > policyNet.pkl 这个是已经保存好的模型 ## Alphago zero 我将在兵棋游戏中复现alphago zero 欢迎关注中科院自动化所智能系统与工程中心 ## Actor-Critic ##