Il Benchmark MDArena Valuta gli Agenti di Codifica su Compiti di Dinamica Molecolare
L'introduzione di MDArena segna un nuovo standard per valutare l'efficacia degli agenti di codifica in flussi di lavoro realistici di dinamica molecolare (MD). Questo benchmark presenta 50 compiti containerizzati provenienti da progetti attivi di simulazione biomolecolare, comprendendo 29 sistemi molecolari e 14 diversi protocolli di ricerca, come analisi di traiettorie, preparazione di sistemi complessi, protocolli di energia libera e campionamento avanzato. Sono state testate sei configurazioni modello/harness, inclusi Codex e OpenCode. In particolare, Codex GPT-5.5, utilizzando uno sforzo di ragionamento extra-alto, ha eccelso con 24 successi su 50 Strict-Pass@1 (48%). È stato seguito da Codex GPT-5.5 Medium con 21 successi e OpenCode Gem. Questa ricerca sottolinea la capacità degli agenti di codifica di semplificare significativamente i flussi di lavoro computazionali di simulazione biomolecolare, favorendo così il progresso scientifico. Lo studio affronta la lacuna nella valutazione dell'affidabilità degli agenti di codifica per compiti MD realistici, e i risultati sono pubblicati su arXiv con l'identificatore 2608.02642.
Fatti principali
- MDArena è un benchmark di 50 compiti containerizzati provenienti da progetti attivi di simulazione biomolecolare.
- Il benchmark copre 29 sistemi molecolari e 14 ampi protocolli di ricerca.
- I protocolli includono analisi di traiettorie, preparazione di sistemi complessi, protocolli di energia libera e campionamento avanzato.
- Sono state valutate sei configurazioni modello/harness, inclusi Codex e OpenCode.
- Codex GPT-5.5 con sforzo di ragionamento extra-alto ha ottenuto 24/50 successi Strict-Pass@1 (48%).
- Codex GPT-5.5 Medium ha ottenuto 21/50 successi.
- Anche OpenCode Gem ha performato, ma il punteggio esatto non è specificato nell'abstract.
- L'articolo è disponibile su arXiv (2608.02642).
Entità
Istituzioni
- arXiv