반응형

VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-SpeechDecoder-only text-to-speech model은 monotonic alignment constraint가 부족하여 mispronunciation, word skipping, repeating 등의 문제가 발생함VALL-TDecoder-only Transformer를 유지하면서 input phoneme sequence에 대한 relative position embedding을 도입Monotonic generation process를 explicitly indicate 하여 zero-shot text-to-speech에 대한 r..
Paper/TTS
2025. 5. 12. 17:27
반응형