I LLM Estraggono Algoritmi di Modelli di Markov Nascosti tramite Apprendimento nel Contesto
Una recente indagine pubblicata su arXiv (2607.22646) esplora le capacità di apprendimento nel contesto (ICL) dei grandi modelli linguistici (LLM) nel prevedere osservazioni future da Modelli di Markov Nascosti (HMM). I ricercatori delineano un approccio in tre fasi per scoprire l'algoritmo fondamentale. Inizialmente, conducono confronti empirici delle azioni dei LLM con potenziali algoritmi, restringendo infine la loro attenzione a tre categorie, sebbene nessuna singola categoria spieghi completamente il comportamento in tutte le configurazioni HMM e lunghezze di sequenza. Successivamente, stabiliscono collegamenti teorici tra queste categorie e dimostrano come ciascuna possa essere realizzata nel contesto da un Trasformatore, confermando ciò in un piccolo Trasformatore addestrato. Infine, presentano la Sonda delle Attivazioni Principali (PAP), un metodo per sondare e intervenire a livello di strato per estrarre elementi algoritmici da LLM pre-addestrati, migliorando la comprensione dei meccanismi ICL dei LLM.
Fatti principali
- Articolo arXiv 2607.22646
- I LLM prevedono le prossime osservazioni dagli HMM tramite ICL
- Identificate tre classi di algoritmi candidati
- Nessuna singola classe spiega tutte le impostazioni HMM e lunghezze di sequenza
- Derivate connessioni teoriche tra le classi candidate
- Costruzione validata in un piccolo Trasformatore addestrato
- Introdotta la Sonda delle Attivazioni Principali (PAP) per sondaggio e intervento
- La PAP isola componenti algoritmiche in LLM pre-addestrati
Entità
Istituzioni
- arXiv