CIDR: Dataset di Codice Industriale su Larga Scala per la Ricerca in Ingegneria del Software
Un nuovo dataset chiamato Curated Industrial Developer Repository (CIDR) è stato lanciato da ricercatori, con una raccolta completa di repository software da collaboratori industriali. Questo dataset comprende 4.225 repository in 75 linguaggi di programmazione, per un totale di 832 milioni di righe di codice grezze, di cui 581 milioni sono righe logiche. Offre metadati dettagliati a livello di repository, storia completa del controllo di versione e approfondimenti sulle pratiche ingegneristiche come l'integrazione continua e i test automatizzati. I repository sono stati raccolti, filtrati e anonimizzati utilizzando una pipeline specializzata a più fasi. Inoltre, il team ha condotto uno studio di fine-tuning su un modello linguistico di codice da 3 miliardi di parametri utilizzando CIDR, valutando il suo impatto sul codice aziendale. CIDR mira a migliorare la ricerca nell'ingegneria del software, inclusa l'intelligenza del codice e l'analisi della qualità del software. Il dataset è descritto in dettaglio in un articolo su arXiv (arXiv:2605.12153).
Fatti principali
- CIDR contiene 4.225 repository
- I repository coprono 75 linguaggi di programmazione
- Totale di 832 milioni di righe di codice grezze
- 581 milioni di righe di codice logiche
- Include la storia completa del controllo di versione
- Include attributi di pratiche ingegneristiche come l'uso di CI e test automatizzati
- Pipeline a più fasi per raccolta, filtraggio e anonimizzazione
- Studio di fine-tuning con modello linguistico di codice da 3 miliardi di parametri
Entità
—