ARTFEED — Contemporary Art Intelligence

Active-SWE: Benchmark per Agenti di Codifica per la Correzione Proattiva di Bug

ai-technology · 2026-08-06

Active-SWE è un nuovo benchmark introdotto in un articolo di ricerca su arXiv (2608.04682) che valuta gli agenti di codifica basati su modelli linguistici di grandi dimensioni (LLM) sulla loro capacità di scoprire e correggere in modo proattivo più bug senza fare affidamento su segnalazioni di problemi. Il benchmark copre 1.663 compiti in sei categorie di bug e otto linguaggi di programmazione, spostando l'attenzione dalla correzione reattiva di bug (dove vengono fornite segnalazioni dettagliate) alla correzione proattiva. La costruzione di Active-SWE coinvolge un nuovo metodo di selezione dei compiti sensibile alla difficoltà, come descritto nell'abstract. Questo lavoro affronta una lacuna pratica nell'ingegneria del software, dove segnalazioni di problemi di alta qualità non sono sempre disponibili. Il benchmark mira a consentire una valutazione più approfondita degli agenti di codifica espandendo l'ambito alla correzione di più bug e agli scenari di scoperta potenziale di bug. L'articolo è scritto da ricercatori ed è stato annunciato come una sottomissione di tipo 'cross' su arXiv.

Fatti principali

  • Active-SWE è un benchmark per valutare gli agenti di codifica sulla correzione proattiva di bug.
  • Copre 1.663 compiti in sei categorie di bug e otto linguaggi.
  • Il benchmark sposta l'attenzione dalla correzione reattiva a quella proattiva.
  • Espande la valutazione alla correzione di più bug e alla scoperta potenziale di bug.
  • La costruzione utilizza un metodo di selezione dei compiti sensibile alla difficoltà.
  • L'articolo è disponibile su arXiv con ID 2608.04682.
  • Il tipo di annuncio è 'cross'.
  • Il benchmark affronta la mancanza di segnalazioni di problemi negli scenari del mondo reale.

Entità

Istituzioni

  • arXiv

Fonti