ARTFEED — Contemporary Art Intelligence

CoRE: Ricompense di Consenso tramite Equilibrio per l'Apprendimento per Rinforzo al Momento del Test

ai-technology · 2026-08-11

Un recente articolo su arXiv (2608.09324v1) presenta CoRE (Consensus Rewards via Equilibrium), un approccio innovativo per l'apprendimento per rinforzo al momento del test utilizzando dati non etichettati. A differenza dei metodi convenzionali che si basano sul voto di maggioranza da N risposte campionate—trascurando così le risposte corrette di minoranza e trattando allo stesso modo tutti i roll-out che corrispondono alla maggioranza—CoRE costruisce un grafo da questi roll-out. Incorpora archi basati su accordo, similarità di ragionamento e confidenza di generazione. Gli insiemi dominanti vengono identificati tramite dinamiche replicator, risultando in una pseudo-etichetta raffinata, una ricompensa graduata per ogni roll-out e un gate di coesione per ogni domanda. CoRE include il voto di maggioranza come caso specifico. L'articolo discute anche un'analisi del valore di blocco che stabilisce una soglia per raggiungere il consenso al fine di identificare risposte corrette di minoranza in mezzo a maggioranze errate più grandi, con la calibrazione della confidenza che migliora questa soglia. Scritto da ricercatori, questo lavoro affronta un problema chiave nell'apprendimento per rinforzo riguardante la mancanza di ricompense ground-truth durante il test, con l'obiettivo di migliorare la stima delle ricompense e il processo decisionale. Sono inclusi approfondimenti teorici e una potenziale validazione sperimentale, sebbene l'abstract enfatizzi gli aspetti teorici. Questa ricerca è significativa per i campi dell'IA e dell'apprendimento automatico, specialmente per coloro che si concentrano sull'apprendimento per rinforzo e sull'adattamento al momento del test.

Fatti principali

  • ID dell'articolo: arXiv:2608.09324v1
  • Titolo: CoRE: Ricompense di Consenso tramite Equilibrio per l'Apprendimento per Rinforzo al Momento del Test
  • Metodo: CoRE utilizza il consenso basato su grafi con dinamiche replicator
  • CoRE generalizza il voto di maggioranza
  • L'analisi del valore di blocco fornisce una soglia per il recupero corretto delle minoranze
  • La calibrazione della confidenza abbassa la soglia in modo moltiplicativo
  • Affronta la mancanza di ricompense ground-truth nell'RL al momento del test
  • Pubblicato su arXiv

Entità

Istituzioni

  • arXiv

Fonti