Studio: i LLM faticano con i nuovi indovinelli cinesi Xiehouyu
Un nuovo studio da arXiv (2607.23440) testa i grandi modelli linguistici sugli indovinelli cinesi xiehouyu, utilizzando esempi inediti creati da linguisti per evitare la contaminazione dei dati. Lo studio impiega domande a scelta multipla, generazione di spiegazioni in forma libera e creazione di nuovi indovinelli per valutare la comprensione. Nei test a scelta multipla, la differenza di accuratezza tra xiehouyu esistenti a bassa frequenza e quelli inediti è stata misurata come indice di memorizzazione. I parlanti nativi hanno mostrato una differenza molto bassa, indicando un'elaborazione simile. I modelli cinesi all'avanguardia hanno registrato una differenza media del 23,6%, mentre i modelli incentrati sull'inglese hanno registrato una media del 5,1%, suggerendo che i modelli cinesi memorizzano più xiehouyu a bassa frequenza a causa di dati di addestramento più ampi. Gemini 3.1 Pro ha mostrato capacità residue sugli xiehouyu inediti.
Fatti principali
- Lo studio testa i LLM sugli indovinelli cinesi xiehouyu
- Xiehouyu inediti creati da linguisti per evitare la contaminazione dei dati
- La valutazione include scelta multipla, generazione di spiegazioni e creazione di nuovi indovinelli
- La differenza di accuratezza tra xiehouyu esistenti e inediti usata come indice di memorizzazione
- I parlanti nativi hanno una differenza di accuratezza molto bassa
- I modelli cinesi all'avanguardia hanno una differenza media del 23,6%
- I modelli incentrati sull'inglese hanno una differenza media del 5,1%
- Gemini 3.1 Pro ha mostrato capacità sugli xiehouyu inediti
Entità
Istituzioni
- arXiv