I LLM faticano con la cancellazione dell'implicatura in un nuovo dataset di benchmark
Un nuovo studio valuta la capacità dei grandi modelli linguistici di riconoscere e aggiornare credenze non espresse attraverso il riconoscimento e la cancellazione dell'implicatura. La ricerca introduce il primo dataset di cancellazione dell'implicatura annotato da esperti, crowdsourcing per i giudizi umani. I risultati mostrano che la comprensione dell'aggiornamento delle credenze da parte dei LLM è in ritardo rispetto agli umani, specialmente in scenari naturali. Esperimenti di controllo suggeriscono che i successi possono dipendere da credenze pregresse, mentre i fallimenti dipendono dal tipo e dalla forma.
Fatti principali
- Lo studio valuta i LLM sul riconoscimento e la cancellazione dell'implicatura
- Creato il primo dataset di cancellazione dell'implicatura annotato da esperti
- Dataset crowdsourcing per i giudizi umani
- La comprensione dell'aggiornamento delle credenze da parte dei LLM è in ritardo rispetto agli umani
- I successi possono derivare dalla dipendenza da credenze pregresse
- I fallimenti dipendono dal tipo e dalla forma dell'implicatura
- Pubblicato su arXiv con ID 2607.25094
- La ricerca si concentra sul fenomeno pragmatico della cancellazione dell'implicatura
Entità
Istituzioni
- arXiv