ARTFEED — Contemporary Art Intelligence

MameLoshnLM: Primo Modello Linguistico Yiddish Open-Source e Benchmark

ai-technology · 2026-08-07

Il primo modello linguistico open-source specifico per lo yiddish, chiamato MameLoshnLM, è stato presentato dai ricercatori, con 8 miliardi di parametri. Questa iniziativa mira a colmare la mancanza di risorse digitali affidabili per lo yiddish, che ha ostacolato i progressi nella modellazione linguistica, nonostante il ricco patrimonio letterario della lingua. Per supportare questo modello, il team ha sviluppato Oytser, un corpus di pre-addestramento di alta qualità che unisce contenuti moderni nativi del web con opere letterarie, insieme a Kashes, un benchmark che comprende compiti come traduzione, analisi linguistica, estrazione di informazioni e comprensione del linguaggio. MameLoshnLM è stato perfezionato attraverso un pre-addestramento continuato su Llama 3.1 8B utilizzando questi dataset. Le valutazioni mostrano che supera i baselines aperti comparabili. I risultati sono pubblicati in un articolo su arXiv (arXiv:2608.05850).

Fatti principali

  • MameLoshnLM è il primo modello linguistico open-source con 8 miliardi di parametri per lo yiddish.
  • Oytser è un nuovo corpus di pre-addestramento yiddish che combina fonti web e letterarie.
  • Kashes è un benchmark multi-task per compiti linguistici yiddish.
  • Il modello è costruito continuando il pre-addestramento su Llama 3.1 8B.
  • MameLoshnLM supera i baselines aperti di scala simile.
  • L'articolo è disponibile su arXiv con ID 2608.05850.
  • I corpora multilingue esistenti spesso contengono testo yiddish rumoroso o classificato erroneamente.
  • Il lavoro mira a colmare le lacune nelle risorse di modellazione linguistica yiddish.

Entità

Istituzioni

  • arXiv

Fonti