TRACE Bench: Un quadro di valutazione basato su checklist per il roleplay
I ricercatori hanno introdotto TRACE Bench, un nuovo framework progettato per valutare i modelli di roleplay in modo più approfondito rispetto a un semplice punteggio unico. Prende ogni profilo di ruolo e lo trasforma in una checklist dettagliata offline. Poi, utilizzando un Agente Utente, interagisce con il modello, aggiornando la checklist in base alle risposte del modello. Questo approccio consente ai ricercatori di tracciare i punteggi fino a elementi specifici e scambi di dialogo, invece di affidarsi a un'impressione generale. Nella loro validazione incrociata, hanno analizzato le trascrizioni di dialogo libero M2 dal MiniMax Role-play Benchmark e hanno trovato solo il 73,74% di allineamento con i punti chiave del profilo di ruolo, mentre TRACE Bench ha raggiunto un impressionante 99,91% con meno interazioni. I risultati sono documentati in un articolo su arXiv (2608.11236), dimostrando l'affidabilità del framework per la valutazione dei sistemi AI di roleplay.
Fatti principali
- TRACE Bench è un framework di valutazione a checklist agentica basato su compiti per modelli di roleplay.
- Scompone ogni profilo di ruolo in una checklist fissa offline.
- Un Agente Utente conversa naturalmente con il modello di roleplay target mentre aggiorna privatamente gli stati della checklist.
- I punteggi risalgono agli elementi della checklist e ai turni di dialogo di supporto.
- La validazione incrociata ha utilizzato le trascrizioni di dialogo libero M2 dal MiniMax Role-play Benchmark.
- Le trascrizioni di chat libera rilasciate coprivano solo il 73,74% dei punti chiave del profilo di ruolo.
- TRACE Bench ha raggiunto il 99,91% di copertura in meno turni.
- Gli esperimenti di robustezza hanno mostrato classifiche stabili in esecuzioni ripetute.
- L'articolo è disponibile su arXiv con identificatore 2608.11236.
Entità
Istituzioni
- arXiv
- MiniMax