ARTFEED — Contemporary Art Intelligence

Difetti nel protocollo gonfiano i risultati del benchmark AutoML a budget brevi

ai-technology · 2026-08-10

Uno studio disponibile su arXiv (2608.07303) indica che il motore AutoML Orcetra ha superato sia FLAML che AutoGluon su 513 dataset OpenML, raggiungendo un tasso di successo del 57,1% entro un tempo di 60 secondi e del 78,4% quando confrontato solo con FLAML a 30 secondi. Tuttavia, questi risultati sono stati influenzati da difetti nel protocollo: il ciclo di ricerca ha valutato tutti i candidati sulla base del test split, riportando il punteggio più alto, il che ha distorto i risultati a causa di numerose stime rumorose. Al contrario, i baseline si basavano sui dati di addestramento, interagendo con il test set solo una volta. Inoltre, sebbene il budget fosse valutato prima dell'esecuzione del candidato, non è stato applicato durante, con Orcetra che ha impiegato in media 120 secondi, 2,24 volte più a lungo di AutoGluon. Gli autori intendono perfezionare la loro metodologia spostando la selezione su un set di validazione in futuri esperimenti.

Fatti principali

  • Orcetra sembrava battere FLAML e AutoGluon su 513 dataset OpenML.
  • Orcetra ha vinto il 57,1% dei dataset con un budget nominale di 60 secondi.
  • Orcetra ha vinto il 78,4% dei dataset contro il solo FLAML a 30 secondi.
  • Il ciclo di ricerca ha valutato ogni candidato sul test split e ha riportato il migliore.
  • I baseline sono stati selezionati sui dati di addestramento e hanno toccato il test set una sola volta.
  • Il budget è stato controllato prima di lanciare un candidato ma mai applicato durante.
  • Orcetra ha consumato una mediana di 120 secondi contro un budget di 60 secondi.
  • Orcetra ha utilizzato 2,24 volte il tempo di parete di AutoGluon.

Entità

Istituzioni

  • arXiv
  • OpenML

Fonti