ARTFEED — Contemporary Art Intelligence

Assiomi di Senso Comune Generati da LLM per NLI: Una Valutazione Senza Riferimenti

ai-technology · 2026-08-13

Uno studio recente pubblicato su arXiv (2507.15100) esplora la capacità dei Large Language Models (LLM) di produrre assiomi di senso comune fattuali per l'Inferenza del Linguaggio Naturale (NLI) e valuta la loro efficacia utilizzando i benchmark SNLI e ANLI. Utilizzando Llama-3.1-70B e gpt-oss-120b, la ricerca presenta un nuovo approccio senza riferimenti attraverso un framework LLM-as-Judge, poiché le metriche di factualità tradizionali sono inadeguate per assiomi di senso comune che non hanno chiari riferimenti testuali. I risultati indicano una disparità significativa tra i modelli: gpt-oss-120b genera prevalentemente assiomi accurati, mentre Llama tende a produrre più imprecisioni. Inoltre, lo studio esamina tre strategie di prompting, sottolineando il potenziale e le sfide dell'uso degli LLM per la conoscenza di senso comune nei compiti NLI.

Fatti principali

  • Lo studio proviene da arXiv:2507.15100.
  • Valuta gli LLM nella generazione di assiomi di senso comune per NLI.
  • Benchmark utilizzati: SNLI e ANLI.
  • Modelli testati: Llama-3.1-70B e gpt-oss-120b.
  • Viene introdotto un metodo LLM-as-Judge senza riferimenti.
  • gpt-oss-120b supera Llama nell'accuratezza degli assiomi.
  • Vengono valutate tre pipeline di prompting.
  • L'abstract è troncato, manca la descrizione completa della terza pipeline.

Entità

Istituzioni

  • arXiv

Fonti