diff --git a/ulmfit/pretrain_lm.py b/ulmfit/pretrain_lm.py index 0847ca6..06853a0 100644 --- a/ulmfit/pretrain_lm.py +++ b/ulmfit/pretrain_lm.py @@ -70,7 +70,7 @@ def pretrain_lm(dir_path, lang='en', cuda_id=0, qrnn=True, subword=False, max_vo read_file(trn_path, 'train') read_file(val_path, 'valid') - sp = get_sentencepiece(dir_path, trn_path, name) + sp = get_sentencepiece(dir_path, trn_path, name, vocab_size=max_vocab) data_lm = TextLMDataBunch.from_csv(dir_path, **sp) itos = data_lm.train_ds.vocab.itos