DBA-Bench: Benchmark per Agenti di Operazioni su Database Basati su LLM
I ricercatori hanno individuato quattro significative discrepanze tra le attuali valutazioni degli agenti di database basati su LLM e le loro prestazioni effettive in ambienti di produzione: fedeltà in ambienti live (interazioni multi-turn con un database attivo), scala e complessità degli spazi di osservazione (analisi causale che coinvolge migliaia di serie temporali, log aziendali e attività simultanee), apertura degli spazi delle soluzioni (varie opzioni di remediation con diversi compromessi operativi) e complessità e copertura degli scenari (guasti che si propagano attraverso meccanismi interni e aree operative). Per affrontare questi problemi, introducono DBA-Bench, un benchmark volto a garantire la fedeltà produttiva, dare priorità ai risultati e consentire scenari riproducibili. DBA-Bench opera in ambienti PostgreSQL strumentati con carichi di lavoro attivi e osservazioni multi-fonte, definendo il successo attraverso il recupero misurabile o la risoluzione dei guasti sotto vincoli di sicurezza.
Fatti principali
- 1. arXiv:2607.22165v1
- 2. Quattro gap identificati tra valutazione e operazioni di produzione
- 3. Gap: fedeltà dell'ambiente live, scala e complessità dello spazio di osservazione, apertura dello spazio delle soluzioni, complessità e copertura degli scenari
- 4. DBA-Bench affronta questi gap
- 5. Utilizza ambienti PostgreSQL strumentati
- 6. Carichi di lavoro attivi, stato persistente, osservazioni multi-fonte
- 7. Successo definito dal recupero misurabile o dall'eliminazione dei guasti sotto vincoli di sicurezza
- 8. Focus sulla fedeltà produttiva e sulla valutazione orientata ai risultati
Entità
—