Nemotron di NVIDIA Adattato al Greco Moderno: Nuovo Benchmark HERA e 0.835 nDCG@10
I ricercatori hanno potenziato lo stack di recupero Nemotron di NVIDIA incorporando il greco moderno, colmando una lacuna nel modello e in importanti benchmark multilingue. I loro risultati, pubblicati in un articolo su arXiv (2608.05138), si concentrano sulla generazione aumentata da recupero (RAG) in settori come diritto, energia, finanza e sanità. Il team ha condotto l'estrazione di corpus, implementato la supervisione sintetica, addestrato il modello di recupero, adattato il ri-ranker e ottimizzato il lettore, portando a un nuovo benchmark chiamato HERA. È interessante notare che una baseline BM25 senza parametri ha superato diversi modelli di recupero denso multilingue esistenti su dataset greci. Dopo il fine-tuning con 65.773 coppie di recupero in greco, l'embedder Nemotron 1B ha migliorato significativamente l'nDCG@10 da 0.362 a 0.835, superando di gran lunga la sua versione originale.
Fatti principali
- Il greco moderno è assente dai modelli di recupero Nemotron di NVIDIA e dai principali benchmark di recupero multilingue.
- L'adattamento mira alla RAG in applicazioni legali, energetiche, finanziarie e mediche.
- Il processo include estrazione di corpus, supervisione sintetica, addestramento del modello di recupero, adattamento del ri-ranker e fine-tuning del lettore.
- È stato introdotto un nuovo benchmark chiamato HERA.
- La baseline BM25 supera diversi modelli di recupero denso multilingue pronti all'uso su corpus greci specialistici.
- Il fine-tuning su 65.773 coppie di recupero in greco ha migliorato l'nDCG@10 da 0.362 a 0.835 per un embedder Nemotron 1B.
- Il modello adattato supera sostanzialmente la sua controparte non adattata.
- La competenza linguistica appresa si trasferisce al greco di dominio generale, ma il vantaggio rispetto a BM25 dipende dal dominio.
- È stato adattato anche un ri-ranker cross-encoder.
- L'articolo è disponibile su arXiv con ID 2608.05138.
Entità
Istituzioni
- NVIDIA
- arXiv