TaPR: Il Perfezionamento delle Politiche Consapevole dei Test Migliora la Riparazione del Codice Multi-Turno
Quindi, c'è questo nuovo approccio chiamato Perfezionamento delle Politiche Consapevole dei Test, o TaPR, che affronta un grande problema negli agenti di generazione di codice multi-turno. Invece di inseguire solo ricompense rapide come il tradizionale apprendimento per rinforzo, TaPR si concentra sul processo continuo di perfezionamento del codice basato sul feedback. Trasforma il feedback dall'esecuzione del codice in un sistema di ricompensa dettagliato per ogni turno, aiutando questi agenti a imparare a correggersi. I test su sei diversi modelli, coprendo 219 compiti da LiveCodeBench, hanno mostrato che TaPR ha aumentato il tasso di successo per le interazioni a tre turni di 2,44 punti percentuali. Nella categoria ad alto margine, l'accuratezza è aumentata dal 30,25% al 33,56%, portando a 42 miglioramenti e 13 regressioni. Puoi consultare la ricerca su arXiv (2608.00494v1); è un passo avanti significativo per l'IA nella programmazione!
Fatti principali
- 1. TaPR trasforma il feedback di esecuzione in una ricompensa densa per turno basata sul rapporto di superamento dei test.
- 2. Utilizza un protocollo di interazione multi-turno coerente.
- 3. Gli esperimenti hanno utilizzato sei modelli su 219 problemi di generazione di codice da LiveCodeBench.
- 4. TaPR ha migliorato il tasso di successo aggregato a tre turni (Pass@3) di 2,44 punti percentuali.
- 5. Nella fascia ad alto margine 7B/8B, l'accuratezza è aumentata dal 30,25% al 33,56% (+3,31 pp).
- 6. Le prove appaiate hanno mostrato 42 miglioramenti e 13 regressioni.
- 7. L'articolo è disponibile su arXiv con ID 2608.00494v1.
- 8. Il lavoro affronta il disallineamento tra ricompense a colpo singolo e perfezionamento guidato dal feedback.
Entità
Istituzioni
- arXiv
- LiveCodeBench