fix speaker dim inference

This commit is contained in:
Alexander Korolev
2021-06-01 15:15:26 +02:00
committed by GitHub
parent 5b89ef2c6e
commit c1eb9bdcca
+1
View File
@@ -255,6 +255,7 @@ class Tacotron2(TacotronAbstract):
if self.num_speakers > 1:
if not self.embeddings_per_sample:
speaker_embeddings = self.speaker_embedding(speaker_ids)[:, None]
speaker_embeddings = torch.unsqueeze(speaker_embeddings, 0).transpose(1, 2)
encoder_outputs = self._concat_speaker_embedding(encoder_outputs, speaker_embeddings)
decoder_outputs, alignments, stop_tokens = self.decoder.inference(encoder_outputs)