티스토리 뷰
Paper/Language Model
[Paper 리뷰] Data-Efficient Targeted Token-Level Preference Optimization for LLM-based Text-to-Speech
feVeRin 2026. 9. 2. 12:53반응형
Data-Efficient Targeted Token-Level Preference Optimization for LLM-based Text-to-Speech
- Preference optimization을 통해 system output을 human feedback과 align 할 수 있음
- TKTO
- Paired data에 의존하지 않고 token-level unit을 target으로 사용해 data-efficient training을 지원
- Token-level annotation 없이 fine-grained alignment signal을 제공
- 논문 (ACL 2026) : Paper Link
1. Introduction
- Text-to-Speech (TTS) model은 Grapheme-to-Phoneme (G2P)를 사용하여 input text를 phoneme sequence로 convert 함
- BUT, G2P는 morphological analysis에 기반하므로 context에 따라 reading/meaning이 변화하는 ambiguous language에 대응하기 어려움
- 대신 CosyVoice2와 같은 Large Language Model (LLM)-based TTS를 사용하면 G2P 없이도 raw text에서 context-aware pronunciation을 생성할 수 있음
- 특히 최근의 LLM-based TTS는 Direct Preference Optimization (DPO)를 활용하여 naturalness, intelligibility, speaker similarity를 추가적으로 개선함
- BUT, DPO는 paired data에 크게 의존하고, utterance-level label과 character-level task 간의 mismatch로 인해 suboptimal alignment가 나타남

-> 그래서 기존 preference optimization의 한계점을 개선한 Token-level Kahneman-Tversky Optimization (TKTO)를 제안
- TKTO
- Paired data에 의존하지 않고 token-level unit을 target으로 사용해 data-efficient training을 지원
- Token-level annotation 없이 fine-grained alignment signal을 제공
< Overall of TKTO >
- Token-level unit을 target으로 활용하는 data-efficient preference optimization paradigm
- 결과적으로 기존보다 우수한 성능을 달성
2. LLM-based Text-to-Speech
- Text $x$에서 output speech token sequence $y=(y_{1},...,y_{T})$로의 conditional generation을 고려하자
- $\pi_{\theta}(y|x)$를 textual input과 previously generated token에 condition 되어 acoustic token을 autoregressively predict 하는 LLM decoder와 같음:
(Eq. 1) $\pi_{\theta}(y|x)=\prod_{t=1}^{T}\pi_{\theta}(y_{t}|x,y_{<t})$
- Output token sequence $y$는 neural vocoder를 통해 speech audio로 transform 됨 - 여기서 논문은 LLM decoder $\pi_{\theta}$가 user feedback/preference data로부터 token-level preference를 학습하도록 training 하는 것을 목표로 함
- $\pi_{\theta}(y|x)$를 textual input과 previously generated token에 condition 되어 acoustic token을 autoregressively predict 하는 LLM decoder와 같음:
3. Method
- 논문은 unpaired data로부터 token-level preference를 optimize 하기 위해 2-step approach를 도입함
- 먼저 각 token이 preference learning에 얼마나 informative 한 지를 quantify 하고 해당 weight를 TKTO objective를 guide 하는 데 사용함
- Targeted Token Weight Estimation
- Token-level preference를 capture 하기 위해 두 개의 contrastive language model $\pi^{+}, \pi^{-}$를 구성하고, 두 model 간의 log-ratio를 사용해 token-level importance weight를 estimate 함
- KTO-based Contrastive LLM Construction
- 논문은 contrastive LLM을 구축하기 위해 KTO-based approach를 활용함
- $\pi^{+}$는 original desirable/undesirable label로 training 되고 $\pi^{-}$는 label이 swap 된 동일한 data로 training 됨
- 여기서 두 contrastive LLM $\pi^{+},\pi^{-}$는 parameter를 share 하지 않음
- Token-level Importance Sampling
- Token weight $w_{t}$는 다음과 같이 estimate 됨:
(Eq. 2) $w_{t}=\exp\left( \mu \cdot \left( \log \frac{\pi^{+}(y_{t}|x,y_{<t})}{\pi^{-}(y_{t}|x,y_{<t})}, L, U\right)\right)$
- $ \log \frac{\pi^{+}(y_{t}|x,y_{<t})}{\pi^{-}(y_{t}|x,y_{<t})}$ : token reward를 estimate 함
- $L<U$ : optimization stability를 위한 lower/upper clamping bound - $\mu$는 scaling factor로써, desirable sample은 $\mu>0$으로 undesirable sample은 $\mu<0$으로 설정함
- Token weight $w_{t}$는 다음과 같이 estimate 됨:

- Token-Level KTO
- 논문은 KTO를 token-level로 extend 한 Token-level KTO (TKTO)를 활용해 finer-grained token-level signal을 학습함
- Token-level Reward and Reference
- 각 token $y_{t}$에 대한 reward $r_{\theta, t}(x,y)$를 reference policy $\pi_{ref}$에 대한 log-ratio로 정의함:
(Eq. 3) $r_{\theta,t}(x,y)=\log \frac{\pi_{\theta}(y_{t}|x,y_{<t})}{\pi_{ref}(y_{t}|x,y_{<t})}$
(Eq. 4) $z_{0,t}=\text{KL}\left( \pi_{\theta}(\cdot |x,y_{<t})|| \pi_{ref}(\cdot |x,y_{<t})\right)$ - $z_{0,t}$ : microbatch에서 estimate 된 fixed reference baseline
- 각 token $y_{t}$에 대한 reward $r_{\theta, t}(x,y)$를 reference policy $\pi_{ref}$에 대한 log-ratio로 정의함:
- Token-level Value Function
- 각 token value $v_{t}$는 logistic-shaped function으로 정의됨:
(Eq. 5) $v_{t}(x,y)=\left\{\begin{matrix} \lambda_{D}\sigma\left(\beta( r_{\theta,t}(x,y)-z_{0,t})\right) & \text{if}\,\,y\sim y_{desirable}|x, \\ \lambda_{U}\sigma\left(\beta (z_{0,t}-r_{\theta, t}(x,y))\right) & \text{if}\,\, y\sim y_{undesirable}|x \\ \end{matrix}\right.$ - $\sigma(\cdot)$은 sigmoid function, $\beta$는 curvature parameter, $\lambda_{D},\lambda_{U}$는 aversion weights를 adjust 하는 역할
- 각 token value $v_{t}$는 logistic-shaped function으로 정의됨:
- Objective Function
- TKTO loss는 token-level value의 weighted sum과 같음:
(Eq. 6) $\mathcal{L}_{TKTO}=\mathbb{E}_{(x,y)}\left[-\sum_{t=1}^{|y|}w_{t}\cdot v_{t}(x,y)\right]$
- $w_{t}$ : importance weight
- TKTO loss는 token-level value의 weighted sum과 같음:
4. Experiments
- Settings
- Dataset : Japanese Speech Dataset
- Comparisons : CosyVoice2
- Results
- 전체적으로 TKTO의 성능이 가장 우수함

- TKTO는 training 시 desirable token의 log-likelihood만 증가시킴

- Desirable token은 전체 평균보다 높은 reward를 가짐

- Case study 측면에서 target characteristic에 해당하는 token은 non-targeted token 보다 더 높은 weight를 가짐

- ABX test 측면에서 TKTO가 더 선호됨

- MOS 측면에서도 TKTO가 더 우수함

- Chinese에 대해서도 generalization이 가능함

반응형
'Paper > Language Model' 카테고리의 다른 글
댓글
