ARTFEED — Contemporary Art Intelligence

DDBench: Nuovo Benchmark per Valutare gli Agenti LLM su Bug nei Sistemi Distribuiti

ai-technology · 2026-08-18

È stato appena introdotto un nuovo benchmark chiamato DDBench per valutare quanto bene gli agenti di codifica basati su LLM possano gestire le riparazioni del codice nei sistemi distribuiti. Sebbene questi agenti abbiano fatto progressi significativi nei compiti di ingegneria del software singoli—raggiungendo punteggi alti negli anni '70 su SWE-bench Verified—il debug in ambienti distribuiti è ancora praticamente inesplorato. I problemi qui spesso coinvolgono vari processi e nodi, rendendo difficile individuare i problemi semplicemente guardando il codice. DDBench affronta due questioni principali: la mancanza di un benchmark per i bug dei sistemi distribuiti e la necessità di studi su come il contesto di debug aggiuntivo influenzi le prestazioni degli agenti. Presenta 60 bug storici provenienti da 13 progetti open-source, organizzati per difficoltà, e li valuta in due diverse impostazioni. Questa ricerca è disponibile in un articolo su arXiv, etichettato 2608.14863, ed è fondamentale per migliorare l'IA nel debug di software complessi.

Fatti principali

  • DDBench è un nuovo benchmark per valutare gli agenti di codifica basati su LLM sui bug dei sistemi distribuiti.
  • Consiste in 60 bug storici provenienti da 13 sistemi distribuiti open-source.
  • I bug sono suddivisi in tre livelli di difficoltà.
  • Ogni caso viene valutato in due condizioni: solo sintomo e contesto aumentato.
  • I modelli all'avanguardia ottengono punteggi alti negli anni '70 su SWE-bench Verified per compiti a processo singolo.
  • Il debug dei sistemi distribuiti è poco esplorato a causa della complessità e della non determinismo.
  • Il benchmark colma le lacune nella valutazione degli LLM per i sistemi distribuiti.
  • L'articolo è disponibile su arXiv con ID 2608.14863.

Entità

Istituzioni

  • arXiv

Fonti