ARTFEED — Contemporary Art Intelligence

Co-RL: Framework RL multi-agente per il ragionamento non supervisionato nei modelli di IA

ai-technology · 2026-08-19

Co-RL, un framework del preprint arXiv 2608.17253, propone che il ragionamento non supervisionato possa emergere attraverso l'addestramento cooperativo multi-agente. L'apprendimento per rinforzo (RL) migliora spesso il ragionamento nei modelli linguistici e visione-linguaggio, ma richiede tipicamente una supervisione di verità di base costosa, come ricompense verificabili, che diventano scarse con l'avanzare delle capacità. L'RL auto-ricompensante riduce questa dipendenza utilizzando le completazioni del modello stesso, ma rischia di rafforzare i bias, ridurre la diversità e causare il collasso dell'addestramento. Co-RL ottimizza invece più modelli disaccoppiati—che non condividono parametri—simultaneamente tramite RL, con ricompense derivate dalla coorte. Questo approccio mira a superare i limiti dell'RL auto-ricompensante.

Fatti principali

  • Co-RL è introdotto come framework di apprendimento per rinforzo multi-agente.
  • Più modelli disaccoppiati non condividono parametri.
  • I modelli vengono ottimizzati simultaneamente tramite RL.
  • L'obiettivo è abilitare il ragionamento non supervisionato.
  • L'RL viene utilizzato per migliorare il ragionamento nei modelli linguistici e visione-linguaggio.
  • I forti successi dell'RL dipendono dalla supervisione di verità di base, come la ricompensa verificabile.
  • L'RL auto-ricompensante può rafforzare i bias, ridurre la diversità e portare al collasso dell'addestramento.
  • L'addestramento cooperativo multi-agente è proposto come soluzione.

Entità

Fonti