Il benchmark ESF-Bench rivela le limitazioni degli LLM nel riempimento di slot in contesti aziendali
È stato rilasciato un nuovo benchmark, ESF-Bench, per valutare i modelli linguistici di grandi dimensioni (LLM) nei compiti di riempimento di slot in ambienti aziendali complessi. Il benchmark comprende 810 campioni multi-turn e 6.530 slot in otto domini, curati da 57 scenari impegnativi osservati in implementazioni reali. I test hanno rivelato che GPT-OSS-120b, un modello all'avanguardia, ha estratto con successo slot solo per il 20,7% dei campioni, evidenziando limitazioni significative. Il dataset, la tassonomia e il codice di valutazione sono disponibili pubblicamente su GitHub per supportare ulteriori ricerche.
Fatti principali
- ESF-Bench è un benchmark per il riempimento di slot aziendali.
- Include 810 campioni multi-turn e 6.530 slot.
- Copre 8 domini unici.
- Basato su una tassonomia di 57 scenari impegnativi.
- GPT-OSS-120b ha raggiunto solo il 20,7% di successo.
- Il dataset del benchmark, la tassonomia e il codice sono rilasciati pubblicamente.
- Si concentra su vincoli aziendali reali e comportamenti degli utenti.
- Mira a migliorare l'implementazione degli LLM nelle applicazioni aziendali.
Entità
Istituzioni
- arXiv
- GitHub