OctoLong: I contesti di codice cross-repository migliorano la modellazione a contesto lungo
Un nuovo studio introduce OctoLong, una pipeline innovativa per l'ingegneria del contesto che utilizza l'analisi AST, i backend del language server e i gestori di pacchetti per raccogliere riferimenti di codice in modo ricorsivo. Questo metodo crea ricchi contesti di codice che includono milioni di token e affronta la sfida delle limitate dipendenze a lungo raggio nei dataset esistenti, che contengono principalmente libri, articoli accademici e repository di codice. I ricercatori hanno utilizzato OctoLong per creare OctoLong-Instruct, una serie di modelli linguistici aperti a contesto lungo basati su modelli base con parametri tra 600M e 14B. Il processo di addestramento ha comportato l'estensione del contesto durante l'addestramento intermedio su una miscela di circa 50 miliardi di token, incorporando circa 6,2 miliardi di token dai contesti di codice OctoLong, più circa 10 miliardi di token per l'ottimizzazione delle istruzioni. L'articolo è disponibile su arXiv con l'identificatore 2608.05141.
Fatti principali
- OctoLong è una pipeline di ingegneria del contesto per curare contesti di codice ricchi di dipendenze.
- Utilizza parser AST, backend del language server e gestore di pacchetti per il recupero ricorsivo dei riferimenti di codice.
- OctoLong-Instruct è una suite di modelli linguistici aperti a contesto lungo.
- I modelli base vanno da 600M a 14B parametri.
- L'addestramento ha incluso l'estensione del contesto durante l'addestramento intermedio su una miscela di ~50B token.
- La miscela contiene ~6,2B token di contesti di codice OctoLong.
- L'ottimizzazione delle istruzioni è seguita con ~10B token.
- Articolo disponibile su arXiv:2608.05141.
Entità
Istituzioni
- arXiv