ARTFEED — Contemporary Art Intelligence

AgentHPOBench: Benchmarking degli Agenti LLM come Ottimizzatori Iperparametrici Sequenziali

ai-technology · 2026-08-03

È stato lanciato un nuovo standard, AgentHPOBench, per valutare l'efficacia degli agenti basati su modelli linguistici di grandi dimensioni (LLM) come ottimizzatori iperparametrici sequenziali per compiti di machine learning. Questo benchmark include 30 compiti eseguibili suddivisi in sette categorie di ricerca, ciascuno dei quali inizia con una baseline validata. Gli agenti eseguono interventi sequenziali, analizzando metriche, configurazioni e log accumulati prima di suggerire la configurazione successiva. La ricerca esamina 12 agenti comunemente utilizzati insieme a baseline HPO tradizionali all'interno di un quadro unificato, scoprendo disparità di prestazioni significative tra gli agenti attuali. Questo studio colma una lacuna nei benchmark esistenti, che di solito enfatizzano la generazione di codice statico o l'accuratezza delle risposte finali piuttosto che l'analisi iterativa dei dati sperimentali. L'articolo è disponibile su arXiv con identificativo 2607.29626.

Fatti principali

  • AgentHPOBench è un benchmark sequenziale per valutare gli agenti LLM come ottimizzatori iperparametrici.
  • Include 30 compiti di machine learning eseguibili in sette categorie di ricerca.
  • Ogni compito inizia con una baseline validata.
  • Gli agenti eseguono interventi sequenziali, osservando configurazioni, metriche e log.
  • 12 agenti ampiamente utilizzati e baseline HPO convenzionali sono valutati sotto un protocollo unificato.
  • I risultati mostrano che gli agenti attuali presentano lacune di prestazioni misurabili.
  • Il benchmark colma una lacuna nei benchmark esistenti che si concentrano sulla generazione di codice statico o sulla correttezza delle risposte finali.
  • L'articolo è disponibile su arXiv con identificativo 2607.29626.

Entità

Istituzioni

  • arXiv

Fonti