FailFast-RestartSmart: Prevedere e Riavviare i Fallimenti degli Agenti SWE
Uno studio recente presenta FailFast-RestartSmart, un controller a due fasi volto a migliorare l'efficacia degli agenti di ingegneria del software (SWE) che affrontano sfide a livello di repository attraverso traiettorie estese di costruzione del contesto. Questa ricerca, disponibile su arXiv (2608.03222), evidenzia che i run falliti prolungati spesso comportano esplorazioni non necessarie o loop, sostenendo la rilevazione precoce dei fallimenti. FailFast opera come un monitor leggero da 0.6B, utilizzando la supervisione terminale e densa fail-to-pass per prevedere i fallimenti basandosi su prefissi osservabili, eliminando la necessità di logit di policy o stati nascosti. Al rilevamento del fallimento, RestartSmart avvia un nuovo rollout con la stessa policy, consentendo all'agente di rivedere, applicare o ignorare il diff del repository interrotto. Questa strategia cerca di mitigare i rischi di terminare prematuramente traiettorie di successo, conservando risorse su tentativi falliti. I risultati di SWE-bench dimostrano che questo metodo può migliorare l'efficienza senza compromettere i tassi di successo, contribuendo al campo in evoluzione dello sviluppo software guidato dall'IA, dove gli agenti di codifica autonomi sono sempre più diffusi. Gli autori suggeriscono un approccio praticabile per la previsione e il riavvio dei fallimenti, potenzialmente riducendo le spese computazionali e aumentando l'affidabilità di questi agenti.
Fatti principali
- Il paper introduce FailFast-RestartSmart, un controller a due stadi per agenti SWE.
- FailFast è un monitor leggero da 0.6B addestrato con supervisione terminale e densa fail-to-pass.
- Prevede il fallimento da prefissi osservabili senza logit di policy o stati nascosti.
- RestartSmart lancia un nuovo rollout con la stessa policy senza la cronologia dei prompt precedenti.
- Il diff del repository interrotto viene offerto come overlay opzionale.
- L'approccio è valutato su SWE-bench.
- I run falliti tendono ad essere più lunghi e mostrano esplorazione ridondante o loop.
- Il paper è disponibile su arXiv con ID 2608.03222.
Entità
Istituzioni
- arXiv