티스토리 뷰

반응형

Data-Efficient Targeted Token-Level Preference Optimization for LLM-based Text-to-Speech


  • Preference optimization을 통해 system output을 human feedback과 align 할 수 있음
  • TKTO
    • Paired data에 의존하지 않고 token-level unit을 target으로 사용해 data-efficient training을 지원
    • Token-level annotation 없이 fine-grained alignment signal을 제공
  • 논문 (ACL 2026) : Paper Link

1. Introduction

  • Text-to-Speech (TTS) model은 Grapheme-to-Phoneme (G2P)를 사용하여 input text를 phoneme sequence로 convert 함
    • BUT, G2P는 morphological analysis에 기반하므로 context에 따라 reading/meaning이 변화하는 ambiguous language에 대응하기 어려움
    • 대신 CosyVoice2와 같은 Large Language Model (LLM)-based TTS를 사용하면 G2P 없이도 raw text에서 context-aware pronunciation을 생성할 수 있음
    • 특히 최근의 LLM-based TTS는 Direct Preference Optimization (DPO)를 활용하여 naturalness, intelligibility, speaker similarity를 추가적으로 개선함
      - BUT, DPO는 paired data에 크게 의존하고, utterance-level label과 character-level task 간의 mismatch로 인해 suboptimal alignment가 나타남

Ambiguity의 예시

-> 그래서 기존 preference optimization의 한계점을 개선한 Token-level Kahneman-Tversky Optimization (TKTO)를 제안

 

  • TKTO
    • Paired data에 의존하지 않고 token-level unit을 target으로 사용해 data-efficient training을 지원
    • Token-level annotation 없이 fine-grained alignment signal을 제공

< Overall of TKTO >

  • Token-level unit을 target으로 활용하는 data-efficient preference optimization paradigm
  • 결과적으로 기존보다 우수한 성능을 달성

2. LLM-based Text-to-Speech

  • Text $x$에서 output speech token sequence $y=(y_{1},...,y_{T})$로의 conditional generation을 고려하자
    • $\pi_{\theta}(y|x)$를 textual input과 previously generated token에 condition 되어 acoustic token을 autoregressively predict 하는 LLM decoder와 같음:
      (Eq. 1) $\pi_{\theta}(y|x)=\prod_{t=1}^{T}\pi_{\theta}(y_{t}|x,y_{<t})$
      - Output token sequence $y$는 neural vocoder를 통해 speech audio로 transform 됨
    • 여기서 논문은 LLM decoder $\pi_{\theta}$가 user feedback/preference data로부터 token-level preference를 학습하도록 training 하는 것을 목표로 함

3. Method

  • 논문은 unpaired data로부터 token-level preference를 optimize 하기 위해 2-step approach를 도입함
    - 먼저 각 token이 preference learning에 얼마나 informative 한 지를 quantify 하고 해당 weight를 TKTO objective를 guide 하는 데 사용함

- Targeted Token Weight Estimation

  • Token-level preference를 capture 하기 위해 두 개의 contrastive language model $\pi^{+}, \pi^{-}$를 구성하고, 두 model 간의 log-ratio를 사용해 token-level importance weight를 estimate 함
  • KTO-based Contrastive LLM Construction
    • 논문은 contrastive LLM을 구축하기 위해 KTO-based approach를 활용함
    • $\pi^{+}$는 original desirable/undesirable label로 training 되고 $\pi^{-}$는 label이 swap 된 동일한 data로 training 됨
      - 여기서 두 contrastive LLM $\pi^{+},\pi^{-}$는 parameter를 share 하지 않음
  • Token-level Importance Sampling
    • Token weight $w_{t}$는 다음과 같이 estimate 됨:
      (Eq. 2) $w_{t}=\exp\left( \mu \cdot \left( \log \frac{\pi^{+}(y_{t}|x,y_{<t})}{\pi^{-}(y_{t}|x,y_{<t})}, L, U\right)\right)$
      - $ \log \frac{\pi^{+}(y_{t}|x,y_{<t})}{\pi^{-}(y_{t}|x,y_{<t})}$ : token reward를 estimate 함
      - $L<U$ : optimization stability를 위한 lower/upper clamping bound
    • $\mu$는 scaling factor로써, desirable sample은 $\mu>0$으로 undesirable sample은 $\mu<0$으로 설정함

Overview

- Token-Level KTO

  • 논문은 KTO를 token-level로 extend 한 Token-level KTO (TKTO)를 활용해 finer-grained token-level signal을 학습함
  • Token-level Reward and Reference
    • 각 token $y_{t}$에 대한 reward $r_{\theta, t}(x,y)$를 reference policy $\pi_{ref}$에 대한 log-ratio로 정의함:
      (Eq. 3) $r_{\theta,t}(x,y)=\log \frac{\pi_{\theta}(y_{t}|x,y_{<t})}{\pi_{ref}(y_{t}|x,y_{<t})}$
      (Eq. 4) $z_{0,t}=\text{KL}\left( \pi_{\theta}(\cdot |x,y_{<t})|| \pi_{ref}(\cdot |x,y_{<t})\right)$
    • $z_{0,t}$ : microbatch에서 estimate 된 fixed reference baseline
  • Token-level Value Function
    • 각 token value $v_{t}$는 logistic-shaped function으로 정의됨:
      (Eq. 5) $v_{t}(x,y)=\left\{\begin{matrix} \lambda_{D}\sigma\left(\beta( r_{\theta,t}(x,y)-z_{0,t})\right) & \text{if}\,\,y\sim y_{desirable}|x, \\ \lambda_{U}\sigma\left(\beta (z_{0,t}-r_{\theta, t}(x,y))\right) & \text{if}\,\, y\sim y_{undesirable}|x \\ \end{matrix}\right.$
    • $\sigma(\cdot)$은 sigmoid function, $\beta$는 curvature parameter, $\lambda_{D},\lambda_{U}$는 aversion weights를 adjust 하는 역할
  • Objective Function
    • TKTO loss는 token-level value의 weighted sum과 같음:
      (Eq. 6) $\mathcal{L}_{TKTO}=\mathbb{E}_{(x,y)}\left[-\sum_{t=1}^{|y|}w_{t}\cdot v_{t}(x,y)\right]$
      - $w_{t}$ : importance weight 

4. Experiments

- Settings

  • Dataset : Japanese Speech Dataset
  • Comparisons : CosyVoice2

- Results

  • 전체적으로 TKTO의 성능이 가장 우수함

Model 성능 비교

  • TKTO는 training 시 desirable token의 log-likelihood만 증가시킴

Token 별 Log-Likelihood

  • Desirable token은 전체 평균보다 높은 reward를 가짐

Token 별 Reward

  • Case study 측면에서 target characteristic에 해당하는 token은 non-targeted token 보다 더 높은 weight를 가짐

Case Study

  • ABX test 측면에서 TKTO가 더 선호됨

ABX Test

  • MOS 측면에서도 TKTO가 더 우수함

NMOS

  • Chinese에 대해서도 generalization이 가능함

Generalization

 

반응형
댓글
최근에 올라온 글
최근에 달린 댓글
«   2026/09   »
1 2 3 4 5
6 7 8 9 10 11 12
13 14 15 16 17 18 19
20 21 22 23 24 25 26
27 28 29 30
Total
Today
Yesterday