Il Merging dei Modelli Consente il Rilevamento di Clone di Codice Cross-Dominio
Uno studio recente su arXiv indaga il merging dei modelli per affrontare la frammentazione nel rilevamento di clone di codice. I rilevatori tradizionali, spesso specializzati, possono subire cali del punteggio F1 superiori al 70% quando utilizzati al di fuori delle loro condizioni previste. I ricercatori hanno adottato cinque tecniche di task-vector per fondere i parametri e hanno condotto test su quattro modelli di codice, tre benchmark e dodici configurazioni. I risultati indicano che l'integrazione di tipi simili può produrre rilevatori cross-dominio di successo, validati attraverso due distinte famiglie di modelli e tre seed casuali. Questa ricerca mira a risolvere le complicazioni derivanti dall'utilizzo di più modelli specializzati e le difficoltà di addestrare un singolo rilevatore con dati incompleti.
Fatti principali
- Paper arXiv:2608.04215
- Calo dell'F1 superiore al 70% tra domini
- Valuta cinque metodi task-vector
- Valuta il layer stitching greedy
- Valuta l'allineamento cross-tokenizer
- Quattro modelli di codice, tre benchmark, dodici configurazioni
- Il merging TIES su stessa base è efficace
- Validato su due famiglie di modelli e tre seed casuali
Entità
Istituzioni
- arXiv