Il Benchmark Non Scritto: Nuova Sfida per l'IA Rivela il Divario nel Ragionamento Astratto
Un recente progetto di ricerca, intitolato 'The Unwritten Benchmark', esplora la capacità delle macchine di comprendere concetti astratti attraverso un nuovo compito chiamato inferenza di parole acustico-cinestetica. Questa sfida valuta i modelli basandosi sull'audio dei suoni della penna e su segnali visivi dei movimenti della mano, evitando l'esposizione diretta al testo scritto. Lo studio rivela che mentre gli esseri umani raggiungono oltre l'80% di precisione con lettere strutturate, modelli avanzati di intelligenza artificiale come GPT-4o e Gemini 2.5-Pro faticano, ottenendo meno del 10%. I risultati sono significativi per sottolineare i limiti delle capacità dell'intelligenza artificiale riguardo al ragionamento astratto e sono disponibili su arXiv con ID 2608.14558v1.
Fatti principali
- The Unwritten Benchmark è una nuova sfida per l'apprendimento automatico multimodale.
- Il compito principale è l'inferenza di parole acustico-cinestetica.
- I modelli devono decifrare parole dall'audio dei graffi di penna e dal video dei movimenti della mano.
- Non viene fornita alcuna traccia di inchiostro visibile.
- Le parole sono presentate in tre diversi stili di scrittura.
- I partecipanti umani raggiungono oltre l'80% di precisione delle lettere ordinate.
- GPT-4o e Gemini 2.5-Pro non superano il 10% di precisione.
- L'articolo è disponibile su arXiv con identificatore 2608.14558v1.
Entità
Istituzioni
- arXiv