반응형
Diff-TTS: A Denoising Diffusion Model for Text-to-SpeechNeural text-to-speech 모델은 여전히 자연스러운 합성과 architecture 효율성이 요구됨Diff-TTS주어진 text에 대해 denoising diffusion을 활용하여 noise signal을 mel-spectrogram으로 변환Text를 condition으로 하는 mel-spectrogram 분포를 학습하기 위한 likelihood-based optimization추론 속도 향상을 위한 accelerated sampling의 도입논문 (INTERSPEECH 2021) : Paper Link1. Introduction대부분의 neural text-to-speech (TTS) 모델은..
Paper/TTS
2023. 12. 19. 11:05
반응형