Difetti nel protocollo gonfiano i risultati del benchmark AutoML a budget brevi
Uno studio disponibile su arXiv (2608.07303) indica che il motore AutoML Orcetra ha superato sia FLAML che AutoGluon su 513 dataset OpenML, raggiungendo un tasso di successo del 57,1% entro un tempo di 60 secondi e del 78,4% quando confrontato solo con FLAML a 30 secondi. Tuttavia, questi risultati sono stati influenzati da difetti nel protocollo: il ciclo di ricerca ha valutato tutti i candidati sulla base del test split, riportando il punteggio più alto, il che ha distorto i risultati a causa di numerose stime rumorose. Al contrario, i baseline si basavano sui dati di addestramento, interagendo con il test set solo una volta. Inoltre, sebbene il budget fosse valutato prima dell'esecuzione del candidato, non è stato applicato durante, con Orcetra che ha impiegato in media 120 secondi, 2,24 volte più a lungo di AutoGluon. Gli autori intendono perfezionare la loro metodologia spostando la selezione su un set di validazione in futuri esperimenti.
Fatti principali
- Orcetra sembrava battere FLAML e AutoGluon su 513 dataset OpenML.
- Orcetra ha vinto il 57,1% dei dataset con un budget nominale di 60 secondi.
- Orcetra ha vinto il 78,4% dei dataset contro il solo FLAML a 30 secondi.
- Il ciclo di ricerca ha valutato ogni candidato sul test split e ha riportato il migliore.
- I baseline sono stati selezionati sui dati di addestramento e hanno toccato il test set una sola volta.
- Il budget è stato controllato prima di lanciare un candidato ma mai applicato durante.
- Orcetra ha consumato una mediana di 120 secondi contro un budget di 60 secondi.
- Orcetra ha utilizzato 2,24 volte il tempo di parete di AutoGluon.
Entità
Istituzioni
- arXiv
- OpenML