ARTFEED — Contemporary Art Intelligence

Bilanciamento del Carico Guidato dalla Geometria per Mixture-of-Experts Visione-Linguaggio

ai-technology · 2026-08-04

Un recente articolo su arXiv (2608.00574v1) presenta una nuova strategia guidata dalla geometria per il bilanciamento del carico nei modelli mixture-of-experts (MoE) visione-linguaggio. I ricercatori sottolineano che la perdita ausiliaria Switch a livello di token convenzionale (Std-Aux) gestisce solo il carico misto di token immagine e testo, il che può portare a errori significativi che si compensano a vicenda. I loro risultati rivelano che lo stesso router addestrato mostra una variazione di oltre cinque volte nello squilibrio del carico quando testato su diverse risoluzioni di immagine. Mantenendo fissi i profili di carico di immagine e testo, derivano la curva di carico precisa al variare della miscela di token, evidenziando che il divario tra carico di immagine e testo influenza la sensibilità alla miscela di token. Inoltre, osservano che la pre-elaborazione fisica può alterare i profili condizionali, un fattore trascurato dalla legge a profilo fisso. Per affrontare questo problema, analizzano la struttura di input del router, scoprendo che immagine e testo occupano aree separate, con i token visivi che si raggruppano fortemente per immagine sorgente. Questa distinzione spinge all'inclusione di componenti separate per immagine e testo nella perdita ausiliaria. Il loro approccio guidato dalla geometria cerca di migliorare il bilanciamento del carico riconoscendo i contributi unici dei token immagine e testo, migliorando potenzialmente l'efficienza dell'addestramento e dell'inferenza nei modelli MoE visione-linguaggio. L'articolo è stato rilasciato su arXiv ed è indicato come una sottomissione di tipo cross.

Fatti principali

  • Articolo arXiv 2608.00574v1
  • Tipo di annuncio: cross
  • La perdita ausiliaria Switch a livello di token standard è chiamata Std-Aux
  • Std-Aux bilancia solo il carico misto
  • Gli errori di carico di immagine e testo possono annullarsi in una miscela
  • Il router mostra una variazione di oltre cinque volte nello squilibrio del carico tra le risoluzioni delle immagini
  • Il divario di carico immagine-testo controlla la sensibilità alla miscela di token
  • La pre-elaborazione fisica può modificare i profili condizionali
  • Il confine di modalità motiva termini separati per immagine e testo

Entità

Istituzioni

  • arXiv

Fonti