ARTFEED — Contemporary Art Intelligence

LeAct: Imparare a Ragionare dalle Azioni degli Esperti

ai-technology · 2026-07-27

Un nuovo metodo chiamato LeAct (Learning to reason from Actions) recupera il ragionamento a catena di pensiero da sistemi esperti che producono azioni quasi ottimali senza spiegazioni. Trattando il ragionamento come una variabile latente, LeAct ottimizza i CoT candidati che migliorano la probabilità dello studente di riprodurre l'azione esperta. L'approccio viene testato su giochi a informazione imperfetta.

Fatti principali

  • 1. I moderni modelli di ragionamento si basano su dati di ragionamento provenienti da annotazioni umane o distillati da LLM più forti.
  • 2. Sistemi esperti come motori di gioco e dimostratori di teoremi producono azioni quasi ottimali ma non scrivono il ragionamento a catena di pensiero.
  • 3. LeAct tratta la catena di pensiero come una variabile latente e la recupera dalla sola azione.
  • 4. Lo studente campiona CoT candidati per ogni azione esperta e conserva quelli che migliorano la propria probabilità di recuperare l'azione.
  • 5. Il metodo viene valutato su giochi a informazione imperfetta.

Entità

Fonti