ARTFEED — Contemporary Art Intelligence

Studio Rivela Come gli LLM Leggono i Report di Bug per la Riparazione Automatica del Software

other · 2026-07-29

È stato condotto uno studio empirico per esplorare la distribuzione dell'attenzione nei Large Language Models (LLM) utilizzati per la riparazione automatica del software. La ricerca esamina 319 bug reali in Python e Java provenienti da SWE-bench Verified e Multi-SWE-bench, con l'obiettivo di rivelare come gli LLM diano priorità ai dettagli nei report di bug. Si concentra su due domande chiave: (RQ1) l'allocazione dell'attenzione del modello attraverso varie sezioni dei report di bug, e (RQ2) le differenze nei pattern di attenzione tra riparazioni riuscite e non riuscite. I risultati offrono preziose intuizioni sul perché gli LLM possano produrre patch accurate per alcuni bug mentre faticano con altri simili, nonostante abbiano lo stesso contesto informativo. Questo studio è pionieristico nell'analisi dei meccanismi di attenzione nella riparazione del software guidata da LLM, migliorando la comprensione del comportamento del modello e delle potenziali strategie per aumentare i tassi di successo della riparazione.

Fatti principali

  • Primo studio empirico sui pattern di attenzione nella riparazione del software basata su LLM
  • Analizza 319 bug reali in Python e Java
  • Utilizza i dataset SWE-bench Verified e Multi-SWE-bench
  • Indaga come l'attenzione del modello è distribuita tra le sezioni del report di bug
  • Confronta i pattern di attenzione tra riparazioni riuscite e non riuscite
  • Mira a spiegare le prestazioni inconsistenti degli LLM nella riparazione automatica del software
  • Fornisce intuizioni interpretabili su come gli LLM elaborano i report di bug
  • Pubblicato su arXiv con ID 2607.25873

Entità

Istituzioni

  • arXiv

Fonti