Apprendimento per Rinforzo per l'Ottimizzazione del Codice Affronta Rumore di Misura e Sparsità della Ricompensa
Un recente preprint su arXiv (2607.25970) affronta le difficoltà associate all'applicazione dell'apprendimento per rinforzo (RL) per ottimizzare il codice. Sebbene l'RL si sia dimostrato efficace nel garantire la correttezza del codice incentivando programmi che superano test nascosti, integrare il tempo di esecuzione nel sistema di ricompensa per l'ottimizzazione presenta notevoli sfide. Gli autori evidenziano tre problemi principali: rumore di misura, sparsità della ricompensa e instabilità di GRPO, che ostacolano l'efficacia dell'RL, producendo soluzioni solo marginalmente migliori con un aumento dei fallimenti. Per affrontare queste sfide, suggeriscono una strategia in tre parti: (1) sviluppare DMC-Optim, un benchmark con ampi test di ottimizzazione e un sandbox calibrato per una valutazione affidabile; (2) unire le ricompense di correttezza e velocità nel framework RL, utilizzando un simulatore offline per previsioni ottimali della configurazione; e (3) modificare GRPO e la valutazione per l'ambiente di esecuzione temporizzato più impegnativo. Questa ricerca mira a rendere il tempo di esecuzione un fattore apprendibile nell'ottimizzazione del codice basata su RL.
Fatti principali
- arXiv:2607.25970 affronta l'RL per l'ottimizzazione del codice.
- L'RL per la correttezza del codice è consolidato premiando i programmi che superano test nascosti.
- Estendere l'RL all'ottimizzazione aggiungendo il tempo di esecuzione alla ricompensa causa problemi.
- Tre problemi chiave: rumore di misura, sparsità della ricompensa, instabilità di GRPO.
- Le soluzioni generate sono appena più veloci e falliscono di più quando il tempo guida la ricompensa.
- Approccio in tre fasi: benchmark DMC-Optim, composizione della ricompensa con simulatore offline, GRPO adattato.
- DMC-Optim include ampi test di ottimizzazione e un sandbox calibrato.
- Il simulatore offline prevede le configurazioni più promettenti per la ricompensa di velocità.
Entità
Istituzioni
- arXiv