반응형
AudioGen: Textually Guided Audio GenerationText-to-Audio 생성에는 몇 가지 어려움이 있음- 동시에 말하는 speaker를 분리하는 것과 같이 object를 구별하는 것이 어려움- Scarce text annotation은 모델의 확장을 어렵게 함- 고품질 audio 합성을 위해서는 높은 sampling rate가 필요하므로 sequence가 길어짐AudioGenLearnt discrete audio representation을 기반으로 동작하는 autoregressive 모델다양한 audio sample을 mix 하여 모델이 source 분리를 internally learn 하는 augmentation을 도입빠른 추론을 위해 multi-stream 모델링을 채..
Paper/Language Model
2024. 3. 5. 10:41
반응형