BODHI: I LLM si ramificano e scoprono inferenze eterogenee?
Uno studio recente pubblicato su arXiv (ID: 2608.02867) esplora se l'apprendimento per rinforzo con ricompense verificabili (RLVR) migliora le capacità di ragionamento dei grandi modelli linguistici (LLM) o semplicemente aumenta l'efficienza del campionamento. I ricercatori hanno condotto esperimenti controllati che coinvolgono la risoluzione di labirinti e hanno sviluppato strutture ad albero derivate dal ragionamento matematico, chiamate BODHI-Trees, basate sull'equivalenza semantica. Questo metodo distingue l'entropia dovuta a differenze stilistiche dalla vera ramificazione inferenziale. I loro risultati rivelano che il collasso dell'entropia delle politiche nei modelli RLVR non è solo un problema sintattico; mostra anche una notevole diminuzione dell'entropia di ramificazione semantica. Sebbene RLVR migliori la conformità ai vincoli ambientali e il backtracking, limita la gamma di possibili inferenze, contribuendo alla discussione in corso sull'esplorazione al momento del test nei LLM addestrati con RLVR.
Fatti principali
- L'articolo è intitolato 'BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?'
- È disponibile su arXiv con ID 2608.02867.
- La ricerca utilizza esperimenti controllati di risoluzione di labirinti e BODHI-Trees per analizzare le tracce di ragionamento.
- Lo studio trova che RLVR riduce l'entropia di ramificazione semantica nei LLM.
- RLVR migliora l'aderenza ai vincoli ambientali e le capacità di backtracking.
- L'articolo dibatte se RLVR espanda la capacità di ragionamento o solo l'efficienza del campionamento.
- I risultati suggeriscono che RLVR restringe lo spazio delle possibili inferenze.
- La ricerca distingue l'entropia della variazione stilistica dalla vera ramificazione inferenziale.
Entità
Istituzioni
- arXiv