LEGO-RL: Nuovo framework allinea gli harness degli agenti di codifica con l'addestramento a policy gradient
L'integrazione dell'apprendimento per rinforzo per gli agenti di codifica dipende da estesi harness per l'esecuzione degli strumenti e il feedback. Purtroppo, questi harness spesso entrano in conflitto con l'addestramento a policy gradient, causando errori ambientali e manipolazione delle ricompense. Per affrontare queste sfide, LEGO-RL collega gli harness degli agenti di codifica con l'ottimizzazione scalabile a policy gradient, mantenendo intatto il loro flusso di controllo. Si basa su tre componenti essenziali: ottimizzazione accurata tramite proxy LLM in-process per l'allineamento a livello di token, ed esecuzione affidabile attraverso l'orchestrazione scalabile di sandbox. L'obiettivo di questo framework è ridurre al minimo le incongruenze nell'addestramento RL mantenendo intatto il flusso di controllo originale dell'harness. Questa ricerca è descritta in un preprint su arXiv con identificatore 2608.17393, con l'obiettivo di migliorare l'affidabilità dell'addestramento RL per gli agenti di codifica.
Fatti principali
- LEGO-RL è un framework per l'apprendimento per rinforzo negli agenti di codifica.
- Si rivolge a harness per agenti di lunga durata per l'integrazione degli strumenti, il contesto del repository e il feedback sull'esecuzione.
- Gli ambienti di esecuzione nativi non sono allineati con l'addestramento a policy gradient.
- I crash ambientali e l'hacking delle ricompense corrompono i segnali di esito.
- Le discrepanze tra addestramento e inferenza disaccoppiano il comportamento di rollout dagli aggiornamenti della policy.
- LEGO-RL collega gli harness con l'ottimizzazione a policy gradient senza modificare il flusso di controllo interno.
- Il framework utilizza proxy LLM in-process per catturare i flussi di generazione grezzi per l'allineamento a livello di token.
- Il paper è disponibile su arXiv come 2608.17393.
Entità
—