DiDPO: Un Nuovo Metodo di Apprendimento per Rinforzo per l'Addestramento di Agenti di Codifica
Uno studio recente intitolato 'DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training' è stato reso disponibile su arXiv (ID: 2608.07147). Questa ricerca affronta un problema significativo nell'apprendimento per rinforzo con ricompense verificabili (RLVR) specificamente per gli agenti di codifica. A differenza dei compiti standard degli agenti, gli agenti di codifica incontrano una sfida complessa di assegnazione del credito, poiché le loro azioni possono influenzare simultaneamente varie aree di un diff di codice, complicando l'attribuzione del successo o del fallimento a modifiche specifiche. Le attuali tecniche RLVR dipendono da ricompense a livello di risultato o di passo, che non affrontano adeguatamente le caratteristiche distintive dei diff di codice. Per affrontare questo problema, gli autori introducono DiDPO, un approccio di apprendimento per rinforzo senza critico che deriva unità di credito a grana fine dalla struttura dei diff di codice. DiDPO struttura le interazioni di codifica multi-turno in passaggi pensiero-azione e identifica i diff di codice per una migliore assegnazione del credito. L'articolo completo è accessibile all'indirizzo https://arxiv.org/abs/2608.07147.
Fatti principali
- Titolo dell'articolo: DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training
- ID arXiv: 2608.07147
- Tipo di annuncio: nuovo
- Propone un metodo RL senza critico per agenti di codifica
- Affronta l'assegnazione del credito a grana fine nei diff di codice
- Utilizza il feedback di esecuzione da compilazione e test come ricompense verificabili
- Organizza le interazioni di codifica multi-turno in passaggi pensiero-azione
- Pubblicato su arXiv
Entità
Istituzioni
- arXiv