ARTFEED — Contemporary Art Intelligence

I modelli LLM di frontiera falliscono il benchmark esperto sui compiti esecutivi europei

ai-technology · 2026-08-06

Un nuovo benchmark, EuroExec, rivela che i modelli linguistici di grandi dimensioni (LLM) di frontiera non raggiungono il giudizio esperto nei compiti decisionali esecutivi europei aperti. Lo studio, pubblicato su arXiv (2608.04549), ha coinvolto oltre 4.000 ore di valutazione umana esperta. Sei LLM di frontiera sono stati testati su 413 compiti scritti da 47 esperti del settore, ciascuno tratto da casi reali. Le risposte sono state valutate manualmente utilizzando una rubrica multi-attributo, liste di controllo specifiche per elemento e classifiche di preferenza, producendo un 'tasso di risoluzione' aggregato. Il modello più forte ha risolto solo il 56,9% dei compiti, mentre le risposte di riferimento scritte da esperti hanno raggiunto prestazioni quasi al massimo e sono state preferite a ogni risposta del modello nel 74% delle classifiche dirette. Ciò colloca i sistemi generativi di frontiera ben al di sotto degli standard professionali per tali sfide complesse e aperte.

Fatti principali

  • EuroExec è un nuovo benchmark per i compiti decisionali esecutivi europei.
  • Lo studio ha coinvolto oltre 4.000 ore di esperti umani.
  • Sono stati valutati sei LLM di frontiera.
  • Il benchmark consiste in 413 compiti scritti da 47 esperti del settore.
  • I compiti sono aperti e di lunga forma, basati su casi reali.
  • Le risposte sono state valutate utilizzando una rubrica multi-attributo e liste di controllo specifiche per elemento.
  • Il modello più forte ha risolto solo il 56,9% dei compiti.
  • Le risposte di riferimento scritte da esperti sono state preferite alle risposte dei modelli nel 74% delle classifiche dirette.

Entità

Istituzioni

  • arXiv

Fonti