FriendBench: Benchmarking dell'Inferenza di Familiarità negli Umani e nell'IA
Un nuovo benchmark chiamato FriendBench è stato presentato dai ricercatori per valutare quanto bene gli umani e i modelli di linguaggio multimodali su larga scala (LLM) possano determinare se due individui si conoscono o sono estranei, basandosi esclusivamente su un clip di 20 secondi di un dialogo rompighiaccio. Lo studio, disponibile su arXiv, valuta 26 modelli di sette diverse aziende rispetto a pannelli umani su 96 coppie accuratamente abbinate. Ogni coppia risponde a prompt identici, permettendo allo stile di interazione di determinare l'esito. I risultati rivelano che il modello principale e i partecipanti umani mostrano un'accuratezza simile in tutte le modalità (testo, audio e video), ma la ottengono in modi distinti: gli umani mostrano una distribuzione di risposte equilibrata, mentre i modelli migliori favoriscono 'estraneo'. Canali arricchiti come il video aiutano entrambi i gruppi, ma solo gli umani traggono beneficio dal comportamento visibile insieme al parlato. I ricercatori hanno reso disponibili gli stimoli, le valutazioni umane e le previsioni dei modelli per future ricerche. Questo studio migliora la nostra comprensione della cognizione sociale dell'IA e informa lo sviluppo di un'inferenza sociale più simile a quella umana nelle macchine.
Fatti principali
- FriendBench è un benchmark per inferire la familiarità da clip di 20 secondi di interazioni diadiche rompighiaccio.
- Lo studio confronta 26 modelli di sette aziende con pannelli umani su 96 coppie bilanciate.
- Il miglior modello e il gruppo umano sono statisticamente indistinguibili in accuratezza su testo, audio e video.
- Gli umani rimangono equilibrati tra risposte 'familiare' ed 'estraneo', mentre i modelli tendono verso 'estraneo'.
- Canali più ricchi aiutano sia gli umani che i modelli, ma solo gli umani traggono beneficio dal comportamento visibile oltre al parlato.
- Gli stimoli, le valutazioni umane e le previsioni dei modelli sono stati rilasciati.
- L'articolo è disponibile su arXiv con ID 2607.29602.
- Lo studio è categorizzato sotto Informatica > Calcolo e Linguaggio.
Entità
Istituzioni
- arXiv