ARTFEED — Contemporary Art Intelligence

CEDAR-GRPO: RL Process-Aware Migliora il Ragionamento Abduttivo nei LLM

ai-technology · 2026-08-18

Un nuovo articolo di ricerca introduce CEDAR-GRPO, un framework di apprendimento per rinforzo process-aware progettato per migliorare il ragionamento abduttivo nei modelli linguistici di grandi dimensioni (LLM). Il ragionamento abduttivo, o inferenza alla migliore spiegazione, è cruciale per dare senso a situazioni incerte, dalla risoluzione di problemi quotidiani alla scoperta scientifica. Tuttavia, la ricerca precedente sui LLM si è concentrata in gran parte su benchmark ristretti e specifici per compito, lasciando poco chiaro se i miglioramenti generalizzino oltre tali benchmark. Gli autori propongono che il post-addestramento con apprendimento per rinforzo (RL) possa migliorare l'abilità abduttiva come capacità trasferibile. CEDAR-GRPO combina la correttezza della risposta finale con ricompense abduttive che valutano la copertura delle evidenze e la direzionalità dall'evidenza alla spiegazione. Quattro LLM a pesi aperti sono stati post-addestrati su un mix controllato e neutrale dal punto di vista del dominio di compiti di generazione di ipotesi abduttive e selezione di ipotesi. I modelli sono stati poi valutati su 11 compiti non visti che coprono selezione di ipotesi, generazione di fatti mancanti, inferenza sconfiggibile e indagine su contesti lunghi. L'articolo è disponibile su arXiv con l'identificatore 2608.14791.

Fatti principali

  • CEDAR-GRPO è un framework di apprendimento per rinforzo process-aware per il ragionamento abduttivo nei LLM.
  • Combina la correttezza della risposta finale con ricompense abduttive per la copertura delle evidenze e la direzionalità dall'evidenza alla spiegazione.
  • Quattro LLM a pesi aperti sono stati post-addestrati su un mix controllato e neutrale dal punto di vista del dominio di compiti abduttivi.
  • La valutazione è stata condotta su 11 compiti non visti che spaziano dalla selezione di ipotesi, alla generazione di fatti mancanti, all'inferenza sconfiggibile e all'indagine su contesti lunghi.
  • L'articolo è disponibile su arXiv con l'identificatore 2608.14791.
  • Il ragionamento abduttivo è descritto come inferenza alla migliore spiegazione.
  • La ricerca mira a migliorare l'abilità abduttiva come capacità di ragionamento trasferibile.
  • Il framework affronta la limitazione dei benchmark specifici per compito nella ricerca precedente sui LLM.

Entità

Istituzioni

  • arXiv

Fonti