GROW: Nuovo Metodo di Apprendimento per Rinforzo per Text-to-Speech con Flow-Matching
È stata introdotta una nuova tecnica di apprendimento per rinforzo denominata GROW (Group-Relative Advantage-Weighted On-Policy RL) per sistemi text-to-speech (TTS) con flow-matching. Questo approccio, descritto in un articolo arXiv (2608.03215), affronta le difficoltà nell'implementare RL in TTS quando si utilizza il campionamento ODE deterministico. A differenza dei metodi convenzionali di policy-gradient a livello di traiettoria che trasformano l'ODE in SDE e monitorano i rapporti di verosimiglianza, GROW si concentra direttamente sull'obiettivo di flow-matching. Campiona un gruppo di enunciati on-policy per ogni prompt, normalizza i reward per intelligibilità e similarità del parlante, e li integra per regolare la regressione di flow-matching. Una penalità di velocità Wasserstein-2 assicura che il modello aggiornato rimanga allineato con un riferimento pre-addestrato congelato, mentre una baseline di reward media di gruppo facilita il vantaggio ponderato. Questo metodo mira a migliorare l'efficienza del TTS senza fare affidamento su perturbazioni stocastiche.
Fatti principali
- GROW è un metodo RL on-policy con vantaggio ponderato relativo al gruppo per TTS con flow-matching.
- Agisce direttamente sull'obiettivo standard di flow-matching, evitando la conversione in SDE.
- Campiona un gruppo di enunciati on-policy per ogni prompt e standardizza i reward.
- Combina reward di intelligibilità e similarità del parlante.
- Una penalità di velocità Wasserstein-2 ancora il modello a un riferimento pre-addestrato congelato.
- Una baseline di reward media di gruppo converte la ponderazione del reward in vantaggio ponderato.
- Per modelli TTS pre-addestrati forti, la ponderazione esponenziale positiva è dominata dall'auto-imitazione indipendente dal reward.
- L'articolo è disponibile su arXiv con ID 2608.03215.
Entità
Istituzioni
- arXiv