From 19507f1d38a81b152f2a7a5f11fe3458168dcc81 Mon Sep 17 00:00:00 2001 From: Ubuntu Date: Sat, 11 May 2019 19:51:27 +0000 Subject: [PATCH] seed + new tokens for poleval2018 --- fastai_contrib/utils.py | 2 +- ulmfit/pretrain_lm.py | 8 +++++++- 2 files changed, 8 insertions(+), 2 deletions(-) diff --git a/fastai_contrib/utils.py b/fastai_contrib/utils.py index 1441ab0..a7538fd 100644 --- a/fastai_contrib/utils.py +++ b/fastai_contrib/utils.py @@ -79,7 +79,7 @@ def get_sentencepiece(cache_dir:PathOrStr, load_text, pre_rules: ListRules=None, pre_rules = pre_rules if pre_rules is not None else defaults.text_pre_rules post_rules = post_rules if post_rules is not None else defaults.text_post_rules - special_cases = defaults.text_spec_tok + special_cases = defaults.text_spec_tok + ['xxlink', 'xxuser', 'xxnumber', 'xxemoji', 'yyemoji'] if not os.path.isfile(cache_dir / 'spm.model') or not os.path.isfile(cache_dir / f'itos.pkl'): # load the text from the train tokens file text = load_text() diff --git a/ulmfit/pretrain_lm.py b/ulmfit/pretrain_lm.py index 6b0b760..63d689b 100644 --- a/ulmfit/pretrain_lm.py +++ b/ulmfit/pretrain_lm.py @@ -159,7 +159,13 @@ class LMHyperParams: json_save(self.model_dir/'info.json', vals) print("Saving info", self.model_dir / 'info.json') - def train_lm(self, num_epochs=20, data_lm=None, bs=70, true_wd=False, drop_mult=0.0, lr=5e-3, label_smoothing_eps=0.0): + def train_lm(self, num_epochs=20, data_lm=None, bs=70, true_wd=False, drop_mult=0.0, lr=5e-3, label_smoothing_eps=0.0, seed=None): + if seed is not None: + print(f"Setting seed to {seed}") + torch.manual_seed(seed) + torch.backends.cudnn.deterministic = True + torch.backends.cudnn.benchmark = False + np.random.seed(seed) self.model_dir.mkdir(exist_ok=True, parents=True) data_lm = self.load_wiki_data(bs=bs) if data_lm is None else data_lm learn = self.create_lm_learner(data_lm, drop_mult=drop_mult, label_smoothing_eps=label_smoothing_eps)