TLA$^{+}$-Bench: Benchmark basato sull'esecuzione per la generazione di specifiche TLA$^{+}$ da linguaggio naturale
Un nuovo dataset e benchmark chiamato TLA$^{+}$-Bench è stato sviluppato da ricercatori per valutare la capacità dei grandi modelli linguistici di produrre specifiche formali TLA$^{+}$ a partire da descrizioni in linguaggio naturale. A differenza dei dataset precedenti, che valutavano in base alla somiglianza con un riferimento o al successo del parsing, TLA$^{+}$-Bench valuta tramite esecuzione: ogni specifica gold è abbinata a una configurazione che il model checker TLA$^{+}$ utilizza per esplorare l'intero spazio degli stati raggiungibili, verificando in modo conclusivo se la specifica soddisfa le proprietà specificate. Il dataset comprende 403 specifiche gold verificate con model checking e 897 specifiche silver solo parse da 13 repository pubblici, includendo precedenti dataset di generazione TLA$^{+}$. Inoltre, presenta quattro descrizioni scritte da modelli in due stili da due fonti, complete di etichette di difficoltà e categoria. Un'osservazione significativa è che un oracolo esatto produce una gamma di metriche di correttezza basate sul metodo di valutazione utilizzato.
Fatti principali
- 1. TLA$^{+}$-Bench valuta tramite esecuzione utilizzando il model checker TLA$^{+}$.
- 2. Il dataset contiene 403 specifiche gold verificate con model checking e 897 specifiche silver solo parse.
- 3. Le specifiche provengono da 13 repository pubblici.
- 4. Include quattro descrizioni scritte da modelli in due stili da due fornitori.
- 5. Le risorse precedenti valutavano in base alla somiglianza con un riferimento o al successo del parsing.
- 6. Risultato chiave: un oracolo esatto fornisce una gamma di numeri di correttezza.
- 7. Il benchmark include dati di generazione TLA$^{+}$ precedenti.
- 8. Le specifiche gold includono una configurazione per il controllo completo dello spazio degli stati raggiungibili.
Entità
—