ARTFEED — Contemporary Art Intelligence

CogArena Benchmark Valuta la Struttura delle Abilità Cognitive degli LLM

ai-technology · 2026-07-29

I ricercatori hanno presentato CogArena, un benchmark composto da 13 paradigmi progettati per valutare le strutture delle abilità cognitive nei modelli linguistici di grandi dimensioni (LLM) attraverso la generazione procedurale. Questo benchmark utilizza un approccio multimodale per identificare quando i punteggi dei compiti cognitivi dovrebbero essere assegnati a etichette dimensionali all'interno di cinque categorie basate sulla teoria. Un'analisi che ha coinvolto 55 modelli a pesi aperti ha rivelato che quasi tutte le correlazioni tra i paradigmi erano positive, con un asse comune che spiegava circa la metà della varianza. Il vantaggio all'interno dei raggruppamenti era minimo, sensibile al punteggio e variava tra le famiglie di modelli. Inoltre, uno studio separato che ha coinvolto 12 modelli di sei famiglie ha indicato un leggero beneficio di raggruppamento abbinato con scaffold specifici, ma nessuna differenza specifica dello scaffold è persistita dopo la correzione per molteplicità, mettendo in discussione l'idea di categorizzare nettamente le abilità cognitive degli LLM.

Fatti principali

  • CogArena è un benchmark di 13 paradigmi generato proceduralmente.
  • Il benchmark valuta la struttura delle abilità cognitive negli LLM.
  • Sono stati testati 55 modelli a pesi aperti.
  • Quasi tutte le correlazioni tra i paradigmi erano positive.
  • Un asse comune spiegava circa la metà della varianza.
  • Il vantaggio all'interno dei raggruppamenti era piccolo e incerto.
  • Uno studio congelato ha coinvolto 12 modelli di sei famiglie.
  • Nessun contrasto specifico dello scaffold è sopravvissuto alla correzione per molteplicità.

Entità

Istituzioni

  • arXiv

Fonti