반응형

F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow MatchingDiffusion Transformer를 기반으로 fully non-autoregressive text-to-speech system을 구성할 수 있음F5-TTSInput을 ConvNeXt로 modeling 하여 text representation을 refine 하고 easier align을 보장Sway Sampling을 Flow Matching-based model에 적용하여 효과적인 training/inference를 지원논문 (ACL 2025) : Paper Link1. IntroductionVALL-E와 같은 Text-to-Speech (TTS) model은 f..
Paper/TTS
2025. 6. 23. 17:07
반응형