ARTFEED — Contemporary Art Intelligence

PATH-Bench: Nuovo Benchmark per la Valutazione Dipendente dal Percorso di Agenti AI Lifelong

ai-technology · 2026-08-04

I ricercatori hanno presentato PATH-Bench, un nuovo benchmark volto a valutare gli agenti LLM lifelong considerando la traiettoria delle esperienze accumulate. A differenza dei benchmark tradizionali, PATH-Bench enfatizza l'impatto delle interazioni precedenti sul trasferimento e la ritenzione della conoscenza da parte degli agenti. Valuta le relazioni tra i compiti attraverso l'apprendimento in contesto multi-modello, crea sequenze incentrate su probe con storie sia benefiche che dannose, e conduce valutazioni ripetute dei compiti probe per misurare la prestazione media, il trasferimento in avanti, il trasferimento all'indietro e l'oblio. Il benchmark è stato applicato a otto agenti rappresentativi in compiti di generazione di codice a turno singolo e di utilizzo di strumenti a turni multipli, rivelando che l'utilità dell'esperienza è influenzata sia dalla sua rappresentazione che dalla struttura di interazione del compito. Lo studio è disponibile su arXiv con l'identificatore 2608.01149.

Fatti principali

  • PATH-Bench è un benchmark per la valutazione dipendente dal percorso di agenti lifelong.
  • Stima le relazioni dirette tra compiti tramite apprendimento in contesto multi-modello.
  • Costruisce sequenze incentrate su probe con storie controllate di aiuto e interferenza.
  • Misura la prestazione media, il trasferimento in avanti, il trasferimento all'indietro e l'oblio.
  • Otto agenti rappresentativi sono stati valutati su compiti di generazione di codice a turno singolo e utilizzo di strumenti a turni multipli.
  • Gli esperimenti includevano storie a dominanza positiva e negativa.
  • I risultati mostrano che l'utilità dell'esperienza dipende dalla rappresentazione e dalla struttura di interazione del compito.
  • L'articolo è disponibile su arXiv (2608.01149).

Entità

Istituzioni

  • arXiv

Fonti