ARTFEED — Contemporary Art Intelligence

GROW: Nuovo Metodo di Apprendimento per Rinforzo per Text-to-Speech con Flow-Matching

ai-technology · 2026-08-06

È stata introdotta una nuova tecnica di apprendimento per rinforzo denominata GROW (Group-Relative Advantage-Weighted On-Policy RL) per sistemi text-to-speech (TTS) con flow-matching. Questo approccio, descritto in un articolo arXiv (2608.03215), affronta le difficoltà nell'implementare RL in TTS quando si utilizza il campionamento ODE deterministico. A differenza dei metodi convenzionali di policy-gradient a livello di traiettoria che trasformano l'ODE in SDE e monitorano i rapporti di verosimiglianza, GROW si concentra direttamente sull'obiettivo di flow-matching. Campiona un gruppo di enunciati on-policy per ogni prompt, normalizza i reward per intelligibilità e similarità del parlante, e li integra per regolare la regressione di flow-matching. Una penalità di velocità Wasserstein-2 assicura che il modello aggiornato rimanga allineato con un riferimento pre-addestrato congelato, mentre una baseline di reward media di gruppo facilita il vantaggio ponderato. Questo metodo mira a migliorare l'efficienza del TTS senza fare affidamento su perturbazioni stocastiche.

Fatti principali

  • GROW è un metodo RL on-policy con vantaggio ponderato relativo al gruppo per TTS con flow-matching.
  • Agisce direttamente sull'obiettivo standard di flow-matching, evitando la conversione in SDE.
  • Campiona un gruppo di enunciati on-policy per ogni prompt e standardizza i reward.
  • Combina reward di intelligibilità e similarità del parlante.
  • Una penalità di velocità Wasserstein-2 ancora il modello a un riferimento pre-addestrato congelato.
  • Una baseline di reward media di gruppo converte la ponderazione del reward in vantaggio ponderato.
  • Per modelli TTS pre-addestrati forti, la ponderazione esponenziale positiva è dominata dall'auto-imitazione indipendente dal reward.
  • L'articolo è disponibile su arXiv con ID 2608.03215.

Entità

Istituzioni

  • arXiv

Fonti