LeAct: Imparare a Ragionare dalle Azioni degli Esperti
Un nuovo metodo chiamato LeAct (Learning to reason from Actions) recupera il ragionamento a catena di pensiero da sistemi esperti che producono azioni quasi ottimali senza spiegazioni. Trattando il ragionamento come una variabile latente, LeAct ottimizza i CoT candidati che migliorano la probabilità dello studente di riprodurre l'azione esperta. L'approccio viene testato su giochi a informazione imperfetta.
Fatti principali
- 1. I moderni modelli di ragionamento si basano su dati di ragionamento provenienti da annotazioni umane o distillati da LLM più forti.
- 2. Sistemi esperti come motori di gioco e dimostratori di teoremi producono azioni quasi ottimali ma non scrivono il ragionamento a catena di pensiero.
- 3. LeAct tratta la catena di pensiero come una variabile latente e la recupera dalla sola azione.
- 4. Lo studente campiona CoT candidati per ogni azione esperta e conserva quelli che migliorano la propria probabilità di recuperare l'azione.
- 5. Il metodo viene valutato su giochi a informazione imperfetta.
Entità
—