From d611d02deb945382d90b2ad4bd4681dca32859e0 Mon Sep 17 00:00:00 2001 From: MishaLaskin Date: Wed, 19 Feb 2020 12:27:54 -0800 Subject: [PATCH] edits --- .gitignore | 3 ++- scripts/run_multiple.sh | 6 +++--- test_run.py | 24 ++++++++++++++++++++++++ train.py | 4 +++- 4 files changed, 32 insertions(+), 5 deletions(-) create mode 100644 test_run.py diff --git a/.gitignore b/.gitignore index b17e166..037ae70 100644 --- a/.gitignore +++ b/.gitignore @@ -1,4 +1,5 @@ tmp/ notebooks/ __pycache__/ -.ipynb_checkpoints/ \ No newline at end of file +.ipynb_checkpoints/ +scripts/run_*.sh \ No newline at end of file diff --git a/scripts/run_multiple.sh b/scripts/run_multiple.sh index 86d5568..2872872 100644 --- a/scripts/run_multiple.sh +++ b/scripts/run_multiple.sh @@ -4,12 +4,12 @@ gpuList=(1 2 3 4 5 6 7) ( for i in ${gpuList[@]}; do CUDA_VISIBLE_DEVICES=$i python train.py \ - --domain_name reacher \ - --task_name easy \ + --domain_name ball_in_cup \ + --task_name catch \ --encoder_type pixel \ --action_repeat 4 \ --save_tb --pre_transform_image_size 100 --image_size 84 \ - --work_dir ./tmp/curl/reacher_easy \ + --work_dir ./tmp/curl/ball_in_cup \ --agent curl_sac --frame_stack 3 \ --seed -1 --critic_lr 1e-3 --actor_lr 1e-3 --eval_freq 20000 --batch_size 128 --num_train_steps 1000000 & done diff --git a/test_run.py b/test_run.py new file mode 100644 index 0000000..7d7f722 --- /dev/null +++ b/test_run.py @@ -0,0 +1,24 @@ +import dmc2gym +import time +import tqdm + +env = dmc2gym.make( + domain_name='reacher', + task_name='easy', + seed=0, + visualize_reward=False, + from_pixels=True, + height=84, + width=84, + frame_skip=3 + ) + +t = time.time() +obs = env.reset() +for i in tqdm.tqdm(range(1000)): + a = env.action_space.sample() + o,r,d,info = env.step(a) + if d: + break + +print('time',time.time()-t) \ No newline at end of file diff --git a/train.py b/train.py index 27de9ec..b306362 100644 --- a/train.py +++ b/train.py @@ -82,6 +82,7 @@ def evaluate(env, agent, video, num_episodes, L, step, args): all_ep_rewards = [] def run_eval_loop(sample_stochastically=True): + start_time = time.time() prefix = 'stochastic_' if sample_stochastically else '' for i in range(num_episodes): obs = env.reset() @@ -104,12 +105,13 @@ def evaluate(env, agent, video, num_episodes, L, step, args): L.log('eval/' + prefix + 'episode_reward', episode_reward, step) all_ep_rewards.append(episode_reward) + L.log('eval/' + prefix + 'eval_time', time.time()-start_time , step) mean_ep_reward = np.mean(all_ep_rewards) best_ep_reward = np.max(all_ep_rewards) L.log('eval/' + prefix + 'mean_episode_reward', mean_ep_reward, step) L.log('eval/' + prefix + 'best_episode_reward', best_ep_reward, step) - run_eval_loop(sample_stochastically=True) + #run_eval_loop(sample_stochastically=True) run_eval_loop(sample_stochastically=False) L.dump(step)