ARTFEED — Contemporary Art Intelligence

OmniLens: Metodo Lente Scalabile per l'Interpretazione di LLM a Qualsiasi Larghezza

ai-technology · 2026-08-13

Un nuovo preprint su arXiv (2608.10260) introduce OmniLens, un metodo lente per l'interpretazione di modelli linguistici di grandi dimensioni (LLM) che si adatta a modelli di qualsiasi larghezza e tipo di componente. Le lenti addestrate tradizionali sono limitate dalla crescita quadratica dei parametri e dagli elevati costi di memoria, limitandole a modelli fino a 20 miliardi di parametri. OmniLens supera queste limitazioni con due tecniche di scalabilità: traduttori a basso rango che riducono i parametri addestrabili fino al 98,4%, e Subset-KL, che materializza solo i logit di vocabolario selezionati, riducendo la memoria di picco dell'addestramento fino al 70% nella sua modalità Top-k. Il metodo applica un'unica famiglia di lenti alle attivazioni del flusso residuo, dell'attenzione e degli MLP, consentendo l'interpretazione di modelli più grandi. L'articolo è stato annunciato come nuova sottomissione arXiv ed è disponibile all'URL fornito.

Fatti principali

  • OmniLens applica un'unica famiglia di lenti a qualsiasi attivazione di larghezza del modello, inclusi flusso residuo, attenzione e MLP.
  • I traduttori a basso rango rendono la crescita dei parametri per lente lineare rispetto alla larghezza del modello, riducendo i parametri addestrabili fino al 98,4%.
  • Subset-KL materializza solo i logit di vocabolario selezionati; la sua modalità Top-k riduce la memoria di picco dell'addestramento fino al 70%.
  • Le lenti addestrate precedenti sono state applicate a modelli di al massimo 20 miliardi di parametri.
  • L'articolo è disponibile su arXiv con ID 2608.10260.
  • Il metodo combina due tecniche di scalabilità indipendenti.
  • L'abstract menziona v campionato per importanza (probabilmente vocabolario) come un'altra modalità di Subset-KL.
  • L'articolo è stato annunciato come nuova sottomissione arXiv.

Entità

Istituzioni

  • arXiv

Fonti