Nuovo benchmark testa il ragionamento logico degli LLM con operatori di probabilità
Un recente articolo su arXiv (ID: 2607.27405) ha stabilito un nuovo standard per valutare i grandi modelli linguistici (LLM) riguardo all'inferenza logica con operatori di probabilità. Questo benchmark enfatizza il ragionamento con frasi che includono modali epistemici graduabili come 'probabilmente', 'potrebbe' e 'deve'. Presenta 14.320 prompt in inglese generati proceduralmente, organizzati in quindici modelli di inferenza che variano sistematicamente nel formato delle domande, nell'approccio alla negazione e nel contenuto. Una valutazione di 29 modelli ha rivelato che molti mostravano bias di risposta non correlati alla struttura logica, favorendo risposte 'Sì' o 'No'. Questa ricerca sottolinea la sfida di separare il ragionamento simbolico basato su principi dal riconoscimento superficiale di pattern negli LLM, in particolare in campi critici come la medicina e il diritto, dove inferenze accurate sull'incertezza sono vitali. Gli autori rimangono anonimi.
Fatti principali
- Introdotto un benchmark per il ragionamento su operatori di probabilità
- Contiene 14.320 prompt in inglese generati proceduralmente
- Utilizzati quindici modelli di inferenza
- Valuta 29 grandi modelli linguistici
- La maggior parte dei modelli mostra bias di risposta indipendenti dalla forma logica
- Osservata una preferenza sistematica per risposte Sì o No
- Rilevante per domini ad alto rischio come medicina e diritto
- Articolo disponibile su arXiv con ID 2607.27405
Entità
Istituzioni
- arXiv