Audit Rivela Lacune di Misurazione nella Previsione dell'IA di Frontiera
Un audit pubblicato il 12 agosto 2026 ha valutato come i record storici influenzano le previsioni riguardanti l'intelligenza artificiale avanzata. L'analisi, identificata dal codice 2608.14903, si è concentrata su 62 sistemi di IA e ha incluso 12 benchmark, sette criteri di valutazione, 144 eventi valutati e 27 documenti sorgente. I risultati chiave hanno rivelato carenze significative, con solo sette sistemi che possiedono sia stime di calcolo che un'osservazione dell'orizzonte temporale METR al 50%. Il rapporto ha scoperto che 19 dei 27 sistemi chiusi mancavano di dati sul calcolo di addestramento, in particolare tutte le uscite del 2026, mentre nessuno dei 35 sistemi a pesi aperti soddisfaceva i requisiti di osservazione dell'orizzonte METR, sollevando preoccupazioni sull'accuratezza delle previsioni.
Fatti principali
- Articolo di audit su arXiv:2608.14903
- Record congelato fino al 12 agosto 2026
- 62 sistemi di IA selezionati
- 12 benchmark versionati
- Sette criteri di capacità o impatto
- 144 eventi valutati
- 27 record sorgente
- 408 relazioni tipizzate
- Solo sette sistemi hanno sia calcolo di addestramento che orizzonte METR al 50%
- Calcolo di addestramento mancante per 19 dei 27 sistemi chiusi
- Nessun sistema a pesi aperti ha osservazione dell'orizzonte METR
- Pendenza del collegamento METR Time Horizon 1.0 a 1.1: 1.206
Entità
Istituzioni
- arXiv
- METR