From 5ffbe8ba5ce6146188a64e4427fa42d781921920 Mon Sep 17 00:00:00 2001 From: Aayush Date: Mon, 19 Nov 2018 19:13:55 +0530 Subject: [PATCH] add vocab_size to sentencepiece --- ulmfit/pretrain_lm.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/ulmfit/pretrain_lm.py b/ulmfit/pretrain_lm.py index 0847ca6..06853a0 100644 --- a/ulmfit/pretrain_lm.py +++ b/ulmfit/pretrain_lm.py @@ -70,7 +70,7 @@ def pretrain_lm(dir_path, lang='en', cuda_id=0, qrnn=True, subword=False, max_vo read_file(trn_path, 'train') read_file(val_path, 'valid') - sp = get_sentencepiece(dir_path, trn_path, name) + sp = get_sentencepiece(dir_path, trn_path, name, vocab_size=max_vocab) data_lm = TextLMDataBunch.from_csv(dir_path, **sp) itos = data_lm.train_ds.vocab.itos