ARTFEED — Contemporary Art Intelligence

Le recensioni degli LLM si allineano con la revisione tra pari umana all'ICLR 2026

ai-technology · 2026-08-06

Uno studio recente caricato su arXiv, intitolato 2608.03659, valuta le prestazioni di tre importanti modelli linguistici di grandi dimensioni (LLM) durante le revisioni tra pari di 300 proposte per la conferenza ICLR 2026, classificate in orali, poster e rifiutate. I modelli esaminati sono GPT-5.4 di OpenAI, Gemini 3.1 Pro Preview di Google e Claude Opus 4.6 di Anthropic. I ricercatori hanno valutato il loro allineamento con le categorie di decisione, le variazioni nelle raccomandazioni e la loro capacità di identificare i punti deboli. Mentre i modelli hanno distinto efficacemente tra lavori accettati e rifiutati, hanno incontrato difficoltà nel differenziare le presentazioni orali dai poster, facendo luce sulle loro capacità e limitazioni nelle revisioni tra pari accademiche.

Fatti principali

  • Lo studio confronta OpenAI GPT-5.4, Google Gemini 3.1 Pro Preview e Anthropic Claude Opus 4.6
  • Sono state utilizzate 300 proposte ICLR 2026 abbinate per argomento
  • I documenti sono stati divisi equamente tra orali, poster e rifiutati
  • I modelli hanno utilizzato istruzioni e scale di valutazione identiche
  • Le informazioni sulla decisione sono state rimosse prima della revisione
  • Tutti e tre gli LLM hanno distinto i documenti accettati da quelli rifiutati
  • Nessuno ha riprodotto la distinzione tra orali e poster
  • Lo studio analizza l'allineamento con le decisioni, l'uso della scala di raccomandazione e la concordanza tematica

Entità

Istituzioni

  • OpenAI
  • Google
  • Anthropic
  • ICLR

Fonti