ARTFEED — Contemporary Art Intelligence

OEIS Open: Benchmark Testa la Capacità dell'IA di Dimostrare Congetture Matematiche

ai-technology · 2026-08-13

I ricercatori hanno introdotto OEIS Open, un benchmark progettato per valutare la capacità dei modelli linguistici (LM) di risolvere congetture matematiche aperte. Il benchmark si basa su 492 congetture aperte tratte dall'Online Encyclopedia of Integer Sequences (OEIS), formalizzate nell'assistente di dimostrazione Lean da Tsoukalas e colleghi. A differenza dei tentativi precedenti che utilizzavano un agente specializzato, OEIS Open fornisce un codice di valutazione open-source che può eseguire qualsiasi modello linguistico generico, con salvaguardie contro l'imbroglio. Lo studio ha rilevato che i LM dotati di un set minimo di strumenti hanno risolto 147 delle congetture (30%) con un budget di $50 per tentativo. Un sottoinsieme più piccolo, OEIS Open Lite, composto da 100 congetture selezionate casualmente, consente una valutazione più economica. Con un budget di $200 per tentativo, il miglior LM attuale ha raggiunto un tasso di successo del 44% su OEIS Open Lite. È interessante notare che fornire ai LM l'accesso a 476.000 articoli da arXiv non ha migliorato le prestazioni, né l'uso di cicli di agente più sofisticati. Le congetture nel benchmark sono di incerta rilevanza matematica e la maggior parte di esse ha probabilmente ricevuto poca attenzione in precedenza. Il lavoro è dettagliato in un articolo su arXiv (2608.11941) e mira a fornire un modo standardizzato per misurare i progressi nella dimostrazione automatica di teoremi.

Fatti principali

  • OEIS Open è un benchmark basato su 492 congetture matematiche aperte tratte dall'OEIS.
  • Le congetture sono formalizzate in Lean da Tsoukalas et al.
  • Il codice di valutazione è open-source e funziona con qualsiasi modello linguistico generico.
  • I LM con strumenti minimi hanno risolto 147 congetture (30%) con un budget di $50 per tentativo.
  • OEIS Open Lite è un sottoinsieme casuale di 100 congetture per una valutazione più economica.
  • Con un budget di $200, il miglior LM ha ottenuto il 44% su OEIS Open Lite.
  • L'accesso a 476.000 articoli arXiv non ha migliorato le prestazioni.
  • Anche cicli di agente più sofisticati non hanno migliorato le prestazioni.
  • Le congetture sono di incerta rilevanza matematica e probabilmente hanno ricevuto poca attenzione.

Entità

Istituzioni

  • OEIS
  • Lean
  • arXiv

Fonti