본문 바로가기 메뉴 바로가기

Let IT Begin

프로필사진
  • 글쓰기
  • 관리
  • 태그
  • 방명록
  • RSS

Let IT Begin

검색하기 폼
  • 분류 전체보기 (662)
    • Music (24)
      • 이달슈 (7)
      • Review (11)
      • Guide (6)
    • 결산 (39)
      • 2020's (9)
      • 2010's (10)
      • 2000's (10)
      • 1990's (10)
    • Paper (564)
      • TTS (196)
      • SVS (25)
      • ASR (12)
      • Vocoder (75)
      • Conversion (62)
      • Neural Codec (63)
      • Language Model (40)
      • Representation (53)
      • Verification (6)
      • Separation (6)
      • ETC (26)
    • Algorithm (34)
  • 방명록

AudioGen (1)
반응형
[Paper 리뷰] AudioGen: Textually Guided Audio Generation

AudioGen: Textually Guided Audio GenerationText-to-Audio 생성에는 몇 가지 어려움이 있음- 동시에 말하는 speaker를 분리하는 것과 같이 object를 구별하는 것이 어려움- Scarce text annotation은 모델의 확장을 어렵게 함- 고품질 audio 합성을 위해서는 높은 sampling rate가 필요하므로 sequence가 길어짐AudioGenLearnt discrete audio representation을 기반으로 동작하는 autoregressive 모델다양한 audio sample을 mix 하여 모델이 source 분리를 internally learn 하는 augmentation을 도입빠른 추론을 위해 multi-stream 모델링을 채..

Paper/Language Model 2024. 3. 5. 10:41
반응형
이전 1 다음
이전 다음
최근에 올라온 글
최근에 달린 댓글
«   2026/08   »
일 월 화 수 목 금 토
1
2 3 4 5 6 7 8
9 10 11 12 13 14 15
16 17 18 19 20 21 22
23 24 25 26 27 28 29
30 31
Total
Today
Yesterday

Blog is powered by Tistory / Designed by Tistory

티스토리툴바