ARTFEED — Contemporary Art Intelligence

DBA-Bench: Benchmark per Agenti di Operazioni su Database Basati su LLM

ai-technology · 2026-07-27

I ricercatori hanno individuato quattro significative discrepanze tra le attuali valutazioni degli agenti di database basati su LLM e le loro prestazioni effettive in ambienti di produzione: fedeltà in ambienti live (interazioni multi-turn con un database attivo), scala e complessità degli spazi di osservazione (analisi causale che coinvolge migliaia di serie temporali, log aziendali e attività simultanee), apertura degli spazi delle soluzioni (varie opzioni di remediation con diversi compromessi operativi) e complessità e copertura degli scenari (guasti che si propagano attraverso meccanismi interni e aree operative). Per affrontare questi problemi, introducono DBA-Bench, un benchmark volto a garantire la fedeltà produttiva, dare priorità ai risultati e consentire scenari riproducibili. DBA-Bench opera in ambienti PostgreSQL strumentati con carichi di lavoro attivi e osservazioni multi-fonte, definendo il successo attraverso il recupero misurabile o la risoluzione dei guasti sotto vincoli di sicurezza.

Fatti principali

  • 1. arXiv:2607.22165v1
  • 2. Quattro gap identificati tra valutazione e operazioni di produzione
  • 3. Gap: fedeltà dell'ambiente live, scala e complessità dello spazio di osservazione, apertura dello spazio delle soluzioni, complessità e copertura degli scenari
  • 4. DBA-Bench affronta questi gap
  • 5. Utilizza ambienti PostgreSQL strumentati
  • 6. Carichi di lavoro attivi, stato persistente, osservazioni multi-fonte
  • 7. Successo definito dal recupero misurabile o dall'eliminazione dei guasti sotto vincoli di sicurezza
  • 8. Focus sulla fedeltà produttiva e sulla valutazione orientata ai risultati

Entità

Fonti