Moltiplicazione di Matrici Ridotta: Metodo Adattivo all'Input per un'Inferenza Efficiente degli LLM
Uno studio recente pubblicato su arXiv (2608.13426) presenta la Moltiplicazione di Matrici Ridotta (RMM), una tecnica di inferenza che si adatta all'input senza richiedere addestramento, volta a diminuire le richieste computazionali dei modelli linguistici basati su Transformer. Questo approccio seleziona fette chiave lungo le dimensioni di contrazione delle moltiplicazioni di matrici senza alterare i pesi del modello, consentendo un equilibrio flessibile tra accuratezza ed efficienza basato su un rapporto di ritenzione. I test condotti su modelli con parametri che vanno da 1B a 70B indicano che la tolleranza alla riduzione varia in base al tipo di modello, al compito, alla componente e al rapporto di ritenzione, spesso migliorando con modelli più grandi. La RMM si dimostra efficace anche con riduzioni moderate in vari contesti, inclusi quelli discriminativi, di generazione autoregressiva e di lungo contesto. I principi si applicano anche all'inferenza multimodale visione-linguaggio, con ablazioni meccanicistiche fornite per chiarire il funzionamento del metodo.
Fatti principali
- Articolo arXiv:2608.13426
- Metodo: Moltiplicazione di Matrici Ridotta (RMM)
- Senza addestramento e adattivo all'input
- Seleziona fette informative lungo le dimensioni di contrazione
- Nessuna modifica dei pesi del modello
- Controllo del rapporto di ritenzione per il compromesso
- Valutato su modelli da 1B a 70B parametri
- Robusto in compiti discriminativi, di generazione e di lungo contesto
- Si estende all'inferenza multimodale visione-linguaggio
Entità
Istituzioni
- arXiv