ARTFEED — Contemporary Art Intelligence

HybridSB-MoE: Miglioramento del parlato dual-domain con routing adattivo degli esperti basato sulla scena

ai-technology · 2026-08-15

Un nuovo framework generativo per il miglioramento del parlato chiamato HybridSB-MoE è stato pubblicato come preprint su arXiv (ID 2608.12715). Questo modello affronta le carenze degli approcci attuali: i modelli spettrali interferiscono con la fase, i modelli waveform trascurano le armoniche e i ponti di Schrödinger (SB) hanno costi di inferenza debolmente connessi. HybridSB-MoE impiega una fusione asimmetrica dell'incertezza, in cui il percorso spettrale cattura l'incertezza epistemica e il ponte waveform tiene conto della varianza aleatoria. Integra inoltre una miscela eterogenea di esperti (MoE) con routing top-k=2 su cinque diversi tipi architetturali. L'obiettivo di questo framework è migliorare la qualità del parlato utilizzando sia il dominio spettrale che quello waveform, adattandosi a vari ambienti acustici. La ricerca è pertinente all'elaborazione audio, all'apprendimento automatico e all'intelligenza artificiale.

Fatti principali

  • HybridSB-MoE è un nuovo framework per il miglioramento generativo del parlato.
  • Affronta tre lacune: i modelli spettrali disturbano la fase, i modelli waveform trascurano le armoniche e i ponti di Schrödinger hanno un costo di inferenza non legato all'addestramento.
  • Il framework utilizza l'elaborazione dual-domain (spettrale e waveform).
  • Impiega una fusione asimmetrica dell'incertezza che combina incertezza epistemica e aleatoria.
  • Utilizza una miscela eterogenea di esperti con routing top-k=2 su cinque archetipi architetturali.
  • L'articolo è disponibile su arXiv con ID 2608.12715.
  • Il tipo di sottomissione è cross.
  • Il framework mira a migliorare il miglioramento del parlato adattandosi a diversi regimi di errore.

Entità

Istituzioni

  • arXiv

Fonti