ARTFEED — Contemporary Art Intelligence

Il benchmark ESF-Bench rivela le limitazioni degli LLM nel riempimento di slot in contesti aziendali

ai-technology · 2026-07-29

È stato rilasciato un nuovo benchmark, ESF-Bench, per valutare i modelli linguistici di grandi dimensioni (LLM) nei compiti di riempimento di slot in ambienti aziendali complessi. Il benchmark comprende 810 campioni multi-turn e 6.530 slot in otto domini, curati da 57 scenari impegnativi osservati in implementazioni reali. I test hanno rivelato che GPT-OSS-120b, un modello all'avanguardia, ha estratto con successo slot solo per il 20,7% dei campioni, evidenziando limitazioni significative. Il dataset, la tassonomia e il codice di valutazione sono disponibili pubblicamente su GitHub per supportare ulteriori ricerche.

Fatti principali

  • ESF-Bench è un benchmark per il riempimento di slot aziendali.
  • Include 810 campioni multi-turn e 6.530 slot.
  • Copre 8 domini unici.
  • Basato su una tassonomia di 57 scenari impegnativi.
  • GPT-OSS-120b ha raggiunto solo il 20,7% di successo.
  • Il dataset del benchmark, la tassonomia e il codice sono rilasciati pubblicamente.
  • Si concentra su vincoli aziendali reali e comportamenti degli utenti.
  • Mira a migliorare l'implementazione degli LLM nelle applicazioni aziendali.

Entità

Istituzioni

  • arXiv
  • GitHub

Fonti