DiG-bench: Nuovo Benchmark AI per la Scoperta Scientifica nei Giochi
I ricercatori hanno rilasciato DiG-bench (Discovery in Games), un nuovo benchmark progettato per valutare la capacità degli agenti AI di effettuare scoperte scientifiche attraverso la sperimentazione in ambienti controllati. Il benchmark consiste in 70 giochi indipendenti, ciascuno codificato come una breve stringa con regole di trasformazione uniche che devono essere scoperte attraverso l'interazione. I giochi sono strutturati su sette livelli di difficoltà, con il livello più basso risolvibile da più modelli e il livello più alto che mette alla prova i migliori harness agentici. Le condizioni di vittoria per ogni livello sono sconosciute, richiedendo agli agenti di formulare generalizzazioni nuove—un aspetto centrale del processo scientifico. Questo benchmark colma una lacuna nel panorama dell'AI, poiché pochi benchmark esistenti sondano direttamente la capacità di scoprire nuova conoscenza quando l'obiettivo è sconosciuto. L'annuncio è stato fatto tramite preprint arXiv 2608.12593.
Fatti principali
- DiG-bench consiste in 70 giochi indipendenti.
- Ogni gioco è codificato come una breve stringa con regole di trasformazione uniche.
- Le regole devono essere scoperte attraverso l'interazione e la sperimentazione.
- Le condizioni di vittoria per ogni livello sono sconosciute.
- I giochi sono forniti su sette livelli di difficoltà.
- Il livello più basso è risolvibile di routine da più modelli.
- Il livello più alto mette alla prova i migliori modelli in harness agentici.
- Il benchmark colma una lacuna nei benchmark AI per la scoperta.
Entità
Istituzioni
- arXiv