반응형
DiffVoice: Text-to-Speech with Latent DiffusionText-to-Speech 모델의 성능 향상을 위해 latent diffusion을 활용할 수 있음DiffVoiceAdversarial training을 활용한 variational autoencoder를 통해 speech signal을 phoneme-rate representation으로 encodeDiffusion model을 통한 latent representation과 duration의 joint modelling논문 (ICASSP 2023) : Paper Link1. IntroductionDiffusion model은 합성 작업에서 뛰어난 성능을 보이고 있음Text-to-Speech (TTS)에서는 acousti..
Paper/TTS
2024. 1. 25. 13:41
반응형