From 961e98a4610a434c750f3488e0f9896d60c24dca Mon Sep 17 00:00:00 2001 From: =?UTF-8?q?Eren=20G=C3=B6lge?= Date: Thu, 25 Nov 2021 17:31:25 +0100 Subject: [PATCH] Add OOV case to tokenizer tests --- tests/text_tests/test_tokenizer.py | 10 ++++++++++ 1 file changed, 10 insertions(+) diff --git a/tests/text_tests/test_tokenizer.py b/tests/text_tests/test_tokenizer.py index 8bee618b..6c48d276 100644 --- a/tests/text_tests/test_tokenizer.py +++ b/tests/text_tests/test_tokenizer.py @@ -52,6 +52,16 @@ class TestTTSTokenizer(unittest.TestCase): self.tokenizer.print_logs() self.tokenizer_ph.print_logs() + def test_not_found_characters(self): + self.ph = ESpeak("en-us") + self.tokenizer_local = TTSTokenizer(use_phonemes=True, characters=IPAPhonemes(), phonemizer=self.ph) + self.assertEqual(len(self.tokenizer.not_found_characters), 0) + text = "Yolk of one egg beaten light" + ids = self.tokenizer_local.text_to_ids(text) + text_hat = self.tokenizer_local.ids_to_text(ids) + self.assertEqual(self.tokenizer_local.not_found_characters, ['̩']) + self.assertEqual(text_hat, "jˈoʊk ʌv wˈʌn ˈɛɡ bˈiːʔn lˈaɪt") + def test_init_from_config(self): @dataclass class Characters(Coqpit):