ARTFEED — Contemporary Art Intelligence

Moltiplicazione di Matrici Ridotta: Metodo Adattivo all'Input per un'Inferenza Efficiente degli LLM

ai-technology · 2026-08-15

Uno studio recente pubblicato su arXiv (2608.13426) presenta la Moltiplicazione di Matrici Ridotta (RMM), una tecnica di inferenza che si adatta all'input senza richiedere addestramento, volta a diminuire le richieste computazionali dei modelli linguistici basati su Transformer. Questo approccio seleziona fette chiave lungo le dimensioni di contrazione delle moltiplicazioni di matrici senza alterare i pesi del modello, consentendo un equilibrio flessibile tra accuratezza ed efficienza basato su un rapporto di ritenzione. I test condotti su modelli con parametri che vanno da 1B a 70B indicano che la tolleranza alla riduzione varia in base al tipo di modello, al compito, alla componente e al rapporto di ritenzione, spesso migliorando con modelli più grandi. La RMM si dimostra efficace anche con riduzioni moderate in vari contesti, inclusi quelli discriminativi, di generazione autoregressiva e di lungo contesto. I principi si applicano anche all'inferenza multimodale visione-linguaggio, con ablazioni meccanicistiche fornite per chiarire il funzionamento del metodo.

Fatti principali

  • Articolo arXiv:2608.13426
  • Metodo: Moltiplicazione di Matrici Ridotta (RMM)
  • Senza addestramento e adattivo all'input
  • Seleziona fette informative lungo le dimensioni di contrazione
  • Nessuna modifica dei pesi del modello
  • Controllo del rapporto di ritenzione per il compromesso
  • Valutato su modelli da 1B a 70B parametri
  • Robusto in compiti discriminativi, di generazione e di lungo contesto
  • Si estende all'inferenza multimodale visione-linguaggio

Entità

Istituzioni

  • arXiv

Fonti