Controllo del Ragionamento nei Modelli Linguistici con Steering Basato su Autoencoder Sparsi
I ricercatori propongono SAE-Steering, un metodo per controllare le strategie di ragionamento nei Modelli di Ragionamento su Larga Scala (LRM) sfruttando gli Autoencoder Sparsi (SAE) per decomporre gli stati nascosti entangled in uno spazio di caratteristiche disambiguato. L'approccio affronta l'inefficienza e gli errori della selezione autonoma delle strategie di ragionamento. Un pipeline a due fasi identifica le caratteristiche specifiche delle strategie dal vasto pool di caratteristiche SAE, consentendo un controllo granulare sui processi di ragionamento come il backtracking e la verifica incrociata. Il lavoro è dettagliato in arXiv:2601.03595.
Fatti principali
- arXiv:2601.03595
- SAE-Steering utilizza Autoencoder Sparsi per decomporre gli stati nascosti
- Pipeline di identificazione delle caratteristiche a due fasi
- Si concentra su strategie di ragionamento come backtracking e verifica incrociata
- Mira a migliorare l'affidabilità e la flessibilità degli LRM
- Affronta l'entanglement concettuale negli stati nascosti
- Il metodo proposto controlla strategie di ragionamento granulari
- La selezione autonoma spesso porta a percorsi inefficienti o errati
Entità
Istituzioni
- arXiv