Bilanciamento del Carico Guidato dalla Geometria per Mixture-of-Experts Visione-Linguaggio
Un recente articolo su arXiv (2608.00574v1) presenta una nuova strategia guidata dalla geometria per il bilanciamento del carico nei modelli mixture-of-experts (MoE) visione-linguaggio. I ricercatori sottolineano che la perdita ausiliaria Switch a livello di token convenzionale (Std-Aux) gestisce solo il carico misto di token immagine e testo, il che può portare a errori significativi che si compensano a vicenda. I loro risultati rivelano che lo stesso router addestrato mostra una variazione di oltre cinque volte nello squilibrio del carico quando testato su diverse risoluzioni di immagine. Mantenendo fissi i profili di carico di immagine e testo, derivano la curva di carico precisa al variare della miscela di token, evidenziando che il divario tra carico di immagine e testo influenza la sensibilità alla miscela di token. Inoltre, osservano che la pre-elaborazione fisica può alterare i profili condizionali, un fattore trascurato dalla legge a profilo fisso. Per affrontare questo problema, analizzano la struttura di input del router, scoprendo che immagine e testo occupano aree separate, con i token visivi che si raggruppano fortemente per immagine sorgente. Questa distinzione spinge all'inclusione di componenti separate per immagine e testo nella perdita ausiliaria. Il loro approccio guidato dalla geometria cerca di migliorare il bilanciamento del carico riconoscendo i contributi unici dei token immagine e testo, migliorando potenzialmente l'efficienza dell'addestramento e dell'inferenza nei modelli MoE visione-linguaggio. L'articolo è stato rilasciato su arXiv ed è indicato come una sottomissione di tipo cross.
Fatti principali
- Articolo arXiv 2608.00574v1
- Tipo di annuncio: cross
- La perdita ausiliaria Switch a livello di token standard è chiamata Std-Aux
- Std-Aux bilancia solo il carico misto
- Gli errori di carico di immagine e testo possono annullarsi in una miscela
- Il router mostra una variazione di oltre cinque volte nello squilibrio del carico tra le risoluzioni delle immagini
- Il divario di carico immagine-testo controlla la sensibilità alla miscela di token
- La pre-elaborazione fisica può modificare i profili condizionali
- Il confine di modalità motiva termini separati per immagine e testo
Entità
Istituzioni
- arXiv