Assiomi di Senso Comune Generati da LLM per NLI: Una Valutazione Senza Riferimenti
Uno studio recente pubblicato su arXiv (2507.15100) esplora la capacità dei Large Language Models (LLM) di produrre assiomi di senso comune fattuali per l'Inferenza del Linguaggio Naturale (NLI) e valuta la loro efficacia utilizzando i benchmark SNLI e ANLI. Utilizzando Llama-3.1-70B e gpt-oss-120b, la ricerca presenta un nuovo approccio senza riferimenti attraverso un framework LLM-as-Judge, poiché le metriche di factualità tradizionali sono inadeguate per assiomi di senso comune che non hanno chiari riferimenti testuali. I risultati indicano una disparità significativa tra i modelli: gpt-oss-120b genera prevalentemente assiomi accurati, mentre Llama tende a produrre più imprecisioni. Inoltre, lo studio esamina tre strategie di prompting, sottolineando il potenziale e le sfide dell'uso degli LLM per la conoscenza di senso comune nei compiti NLI.
Fatti principali
- Lo studio proviene da arXiv:2507.15100.
- Valuta gli LLM nella generazione di assiomi di senso comune per NLI.
- Benchmark utilizzati: SNLI e ANLI.
- Modelli testati: Llama-3.1-70B e gpt-oss-120b.
- Viene introdotto un metodo LLM-as-Judge senza riferimenti.
- gpt-oss-120b supera Llama nell'accuratezza degli assiomi.
- Vengono valutate tre pipeline di prompting.
- L'abstract è troncato, manca la descrizione completa della terza pipeline.
Entità
Istituzioni
- arXiv