MameLoshnLM: Primo Modello Linguistico Yiddish Open-Source e Benchmark
Il primo modello linguistico open-source specifico per lo yiddish, chiamato MameLoshnLM, è stato presentato dai ricercatori, con 8 miliardi di parametri. Questa iniziativa mira a colmare la mancanza di risorse digitali affidabili per lo yiddish, che ha ostacolato i progressi nella modellazione linguistica, nonostante il ricco patrimonio letterario della lingua. Per supportare questo modello, il team ha sviluppato Oytser, un corpus di pre-addestramento di alta qualità che unisce contenuti moderni nativi del web con opere letterarie, insieme a Kashes, un benchmark che comprende compiti come traduzione, analisi linguistica, estrazione di informazioni e comprensione del linguaggio. MameLoshnLM è stato perfezionato attraverso un pre-addestramento continuato su Llama 3.1 8B utilizzando questi dataset. Le valutazioni mostrano che supera i baselines aperti comparabili. I risultati sono pubblicati in un articolo su arXiv (arXiv:2608.05850).
Fatti principali
- MameLoshnLM è il primo modello linguistico open-source con 8 miliardi di parametri per lo yiddish.
- Oytser è un nuovo corpus di pre-addestramento yiddish che combina fonti web e letterarie.
- Kashes è un benchmark multi-task per compiti linguistici yiddish.
- Il modello è costruito continuando il pre-addestramento su Llama 3.1 8B.
- MameLoshnLM supera i baselines aperti di scala simile.
- L'articolo è disponibile su arXiv con ID 2608.05850.
- I corpora multilingue esistenti spesso contengono testo yiddish rumoroso o classificato erroneamente.
- Il lavoro mira a colmare le lacune nelle risorse di modellazione linguistica yiddish.
Entità
Istituzioni
- arXiv