ARTFEED — Contemporary Art Intelligence

BODHI: I LLM si ramificano e scoprono inferenze eterogenee?

ai-technology · 2026-08-06

Uno studio recente pubblicato su arXiv (ID: 2608.02867) esplora se l'apprendimento per rinforzo con ricompense verificabili (RLVR) migliora le capacità di ragionamento dei grandi modelli linguistici (LLM) o semplicemente aumenta l'efficienza del campionamento. I ricercatori hanno condotto esperimenti controllati che coinvolgono la risoluzione di labirinti e hanno sviluppato strutture ad albero derivate dal ragionamento matematico, chiamate BODHI-Trees, basate sull'equivalenza semantica. Questo metodo distingue l'entropia dovuta a differenze stilistiche dalla vera ramificazione inferenziale. I loro risultati rivelano che il collasso dell'entropia delle politiche nei modelli RLVR non è solo un problema sintattico; mostra anche una notevole diminuzione dell'entropia di ramificazione semantica. Sebbene RLVR migliori la conformità ai vincoli ambientali e il backtracking, limita la gamma di possibili inferenze, contribuendo alla discussione in corso sull'esplorazione al momento del test nei LLM addestrati con RLVR.

Fatti principali

  • L'articolo è intitolato 'BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?'
  • È disponibile su arXiv con ID 2608.02867.
  • La ricerca utilizza esperimenti controllati di risoluzione di labirinti e BODHI-Trees per analizzare le tracce di ragionamento.
  • Lo studio trova che RLVR riduce l'entropia di ramificazione semantica nei LLM.
  • RLVR migliora l'aderenza ai vincoli ambientali e le capacità di backtracking.
  • L'articolo dibatte se RLVR espanda la capacità di ragionamento o solo l'efficienza del campionamento.
  • I risultati suggeriscono che RLVR restringe lo spazio delle possibili inferenze.
  • La ricerca distingue l'entropia della variazione stilistica dalla vera ramificazione inferenziale.

Entità

Istituzioni

  • arXiv

Fonti