ARTFEED — Contemporary Art Intelligence

Sintesi Voce-Volto da Immagini Statiche tramite Style Diffusion

ai-technology · 2026-07-30

I ricercatori hanno introdotto un sistema Face-to-Speech (F2S) in grado di produrre una voce realistica a partire da un'immagine facciale statica, eliminando la necessità di un riferimento audio. Un compatto Face Adapter armonizza le caratteristiche di riconoscimento facciale con lo spazio stilistico di un modello StyleTTS 2 statico, utilizzando un soft-tuning sugli strati superiori dell'encoder facciale. Testato su LRS3, un dataset audiovisivo di TED-talk in inglese, il parlato generato ha ottenuto punteggi UTMOS compresi tra 3.7 e 4.0, eguagliando o superando il punteggio ground truth di 3.61. I tassi di recupero voce-volto sono superiori al caso e le voci sintetizzate si allineano bene con i parlanti previsti. Inoltre, l'adattatore addestrato in inglese può generare fluentemente parlato in spagnolo senza alcun riaddestramento, affrontando le sfide della sintesi vocale zero-shot per personaggi storici o personaggi di videogiochi basati esclusivamente su input visivo.

Fatti principali

  • Il framework Face-to-Speech predice la voce da un'immagine facciale statica
  • Utilizza un leggero Face Adapter e il soft-tuning dei blocchi superiori dell'encoder facciale
  • Allinea le caratteristiche di riconoscimento facciale con lo spazio stilistico del modello StyleTTS 2 congelato
  • Valutato sul corpus LRS3 di video TED-talk in inglese
  • Punteggi UTMOS 3.7-4.0, superiori al ground truth di 3.61
  • Recupero voce-volto superiore al caso
  • Voce generata coerente con il parlante target
  • L'adattatore addestrato in inglese produce spagnolo fluente senza riaddestramento

Entità

Fonti