ARTFEED — Contemporary Art Intelligence

Il Benchmark Non Scritto: Nuova Sfida per l'IA Rivela il Divario nel Ragionamento Astratto

ai-technology · 2026-08-18

Un recente progetto di ricerca, intitolato 'The Unwritten Benchmark', esplora la capacità delle macchine di comprendere concetti astratti attraverso un nuovo compito chiamato inferenza di parole acustico-cinestetica. Questa sfida valuta i modelli basandosi sull'audio dei suoni della penna e su segnali visivi dei movimenti della mano, evitando l'esposizione diretta al testo scritto. Lo studio rivela che mentre gli esseri umani raggiungono oltre l'80% di precisione con lettere strutturate, modelli avanzati di intelligenza artificiale come GPT-4o e Gemini 2.5-Pro faticano, ottenendo meno del 10%. I risultati sono significativi per sottolineare i limiti delle capacità dell'intelligenza artificiale riguardo al ragionamento astratto e sono disponibili su arXiv con ID 2608.14558v1.

Fatti principali

  • The Unwritten Benchmark è una nuova sfida per l'apprendimento automatico multimodale.
  • Il compito principale è l'inferenza di parole acustico-cinestetica.
  • I modelli devono decifrare parole dall'audio dei graffi di penna e dal video dei movimenti della mano.
  • Non viene fornita alcuna traccia di inchiostro visibile.
  • Le parole sono presentate in tre diversi stili di scrittura.
  • I partecipanti umani raggiungono oltre l'80% di precisione delle lettere ordinate.
  • GPT-4o e Gemini 2.5-Pro non superano il 10% di precisione.
  • L'articolo è disponibile su arXiv con identificatore 2608.14558v1.

Entità

Istituzioni

  • arXiv

Fonti