ARTFEED — Contemporary Art Intelligence

PluginEval: Nuovo Benchmark per l'Attribuzione Fine degli Errori nel Routing degli Strumenti

ai-technology · 2026-08-11

Un nuovo benchmark diagnostico chiamato PluginEval è stato sviluppato dai ricercatori per valutare l'attribuzione fine degli errori nelle chiamate di funzione da parte dei grandi modelli linguistici (LLM). Questo benchmark affronta tre problemi strutturali chiave nelle tecniche di valutazione esistenti: la prevalenza di distribuzioni dei dati a legge di potenza che non rappresentano adeguatamente i casi rari, la mancanza di hard negative avversariali che mascherano le disparità di prestazioni tra i modelli, e la dipendenza da giudizi non validati degli LLM nei processi di annotazione. PluginEval utilizza un approccio in due fasi: inizialmente, tratta il routing degli strumenti come una sequenza di tre decisioni, distinguendo la generazione dalla verifica, dove gli LLM suggeriscono chiamate candidate e la validazione deterministica insieme all'esecuzione effettiva delle API fornisce indicatori di qualità affidabili. Successivamente, scompone ogni plugin per capacità, intenzione e confine per individuare scenari di attivazione ed esclusione, generando query a un livello dettagliato. Il benchmark mira a migliorare l'affidabilità del routing degli strumenti man mano che gli LLM assumono ruoli più autonomi. L'articolo correlato è disponibile su arXiv con l'identificatore 2608.08700.

Fatti principali

  • PluginEval è un nuovo benchmark per valutare le chiamate di funzione negli LLM.
  • Affronta tre limitazioni: distribuzioni dei dati a legge di potenza, mancanza di hard negative avversariali e annotazioni LLM non validate.
  • Il benchmark utilizza un framework in due fasi: separando la generazione dalla verifica.
  • La verifica include validazione deterministica e esecuzione reale delle API.
  • I plugin sono scomposti per capacità, intenzione e confine per identificare scenari di attivazione ed esclusione.
  • L'articolo è disponibile su arXiv con ID 2608.08700.
  • Il benchmark mira a migliorare l'affidabilità del routing degli strumenti per agenti autonomi.

Entità

Istituzioni

  • arXiv

Fonti