Code-Switching Kazako-Russo: Il Confine di Annotazione, Non il Modello, è la Chiave per l'Identificazione
Una recente ricerca disponibile su arXiv ha proposto un cambiamento nel modo in cui viene analizzato il code-switching, in particolare tra le lingue kazaka e russa. Lo studio sottolinea che le definizioni dei confini tra prestiti linguistici e code-switching sono più critiche dei modelli utilizzati per identificarli. Introduce un dataset unico di identificazione della lingua basato su interazioni kazako-russe sui social media, categorizzando i termini russi come kazaki e marcando alcuni cambi di frase come 'misti'. In particolare, gli autori hanno scoperto che il modo in cui questi confini vengono annotati influenza significativamente l'efficacia delle tecniche di identificazione della lingua. Il dataset e il codice correlato sono offerti per ulteriori esplorazioni nel campo.
Fatti principali
- Titolo del paper: 'Prestito o Switch? Il Confine di Annotazione, Non il Modello, Guida l'Identificazione del Code-Switching Kazako-Russo'
- Pubblicato su arXiv con ID 2608.00581
- Rilascia un set gold LID a livello di documento per il testo sociale kazako-russo
- La linea guida tratta i prestiti russi integrati come kazaki, riservando 'misto' per gli switch a livello di clausola
- Include un pool di sentiment solo misto per la cascata filter-first
- Valuta FastText, Lingua, HeLI (raw e windowed), character-trigram NB e XLM-R
- Trova che il confine di annotazione è il collo di bottiglia, non la classe di modello
- La condivisione dell'alfabeto cirillico causa una sovra-etichettatura dei prestiti come code-switching
Entità
Istituzioni
- arXiv