CALVER: La verifica simbolica potenzia il ragionamento causale nei LLM
Un recente articolo pubblicato su arXiv (2608.03506) presenta CALVER (Causal Axiom-Level VERification), un verificatore simbolico che non richiede addestramento e mira a migliorare il ragionamento causale best-of-K nei grandi modelli linguistici (LLM). Evidenzia una debolezza nelle tecniche di auto-consistenza, dove la risposta più comune potrebbe essere inaffidabile a causa di errori di confondimento ricorrenti. CALVER valuta tracce strutturate basandosi sugli standard causali di Pearl e seleziona il candidato con il punteggio più alto. Per le query CLEAR find-one-valid, CALVER raggiunge un'accuratezza del 42,1%, mentre i metodi concorrenti si aggirano intorno al 30%. In un audit del sottoinsieme clean-core, 11 delle 21 selezioni effettuate da CALVER differiscono dalla verità di base del benchmark, indicando che potrebbe scoprire risposte valide mancate dal benchmark. L'articolo è scritto da ricercatori ed è accessibile su arXiv.
Fatti principali
- CALVER è un verificatore simbolico senza addestramento per il ragionamento causale nei LLM.
- Valuta tracce strutturate secondo i criteri causali di Pearl: d-separazione, aggiustamento backdoor e intervento.
- Sulle query CLEAR find-one-valid, CALVER raggiunge un'accuratezza del 42,1%.
- Pluralità, modello di ricompensa, giudice LLM e confidenza del modello rimangono vicini al 30% su pool congelati identici.
- Aumentare il giudice a 72B non colma il divario di prestazioni.
- In un sottoinsieme clean-core sottoposto a revisione, 11 delle 21 selezioni di CALVER valide per il grafo differiscono dalla verità di base del benchmark.
- L'articolo è disponibile su arXiv con ID 2608.03506.
- CALVER non consulta una risposta di riferimento durante la selezione.
Entità
Istituzioni
- arXiv