ForestBench: Quadro Grafico Unificato per la Valutazione della Collaborazione Multi-Agente
Un nuovo quadro di valutazione per sistemi multi-agente (MAS) che sfruttano modelli linguistici di grandi dimensioni (LLM) è stato descritto in un articolo su arXiv (2608.08605). Questo quadro, chiamato ForestBench, affronta la difficoltà di valutare varie tecniche MAS traducendo le loro tracce di esecuzione in uno spazio comune di grafi di collaborazione unificati. Ciò consente la valutazione di diversi metodi utilizzando la stessa rappresentazione, set di riferimento e metriche. I grafi candidati vengono valutati rispetto a una foresta di riferimento specifica per query, che consiste in grafi di successo verificati dal benchmark. Invece di prescrivere un unico approccio migliore, la foresta mostra molteplici modi in cui metodi MAS rappresentativi possono raggiungere un compito. Il quadro filtra 844 compiti che richiedono collaborazione per l'istanziazione. L'articolo evidenzia anche le carenze dei metodi attuali: i benchmark basati solo sui risultati trascurano le specifiche della collaborazione, e le valutazioni LLM-as-Judge dipendono da inferenze specifiche del modello, che possono variare. Il quadro proposto aspira a stabilire uno standard per la valutazione dei metodi. Scritto da ricercatori, l'articolo è accessibile su arXiv.
Fatti principali
- ForestBench è un quadro grafico unificato per la valutazione della collaborazione multi-agente.
- Mappa le tracce MAS native in uno spazio condiviso di grafi di collaborazione unificati.
- I grafi candidati vengono confrontati con una foresta di riferimento specifica per query.
- La foresta di riferimento è una raccolta di grafi di successo verificati.
- Il quadro filtra 844 compiti che richiedono collaborazione.
- I benchmark basati solo sui risultati trascurano le collaborazioni.
- La valutazione LLM-as-Judge richiede inferenze aggiuntive e può variare.
- L'articolo è disponibile su arXiv con ID 2608.08605.
Entità
Istituzioni
- arXiv