pico-type: un classificatore di contenuti multi-head a livello di byte con 1,5 milioni di parametri
È stato sviluppato un classificatore di contenuti innovativo chiamato pico-type, che opera a livello di byte con circa 1,5 milioni di parametri. Questo modello innovativo può valutare sette caratteristiche distinte del contenuto direttamente dai byte UTF-8 grezzi, eliminando la necessità di tokenizer o embedding pre-addestrati. Pico-type categorizza i dati in 12 classi di tipo grossolano, otto modalità, 24 sottotipi, 62 linguaggi di programmazione, 30 lingue testuali e 90 tipi MIME, insieme a sei flag di rischio. La sua struttura include embedding di byte, tre blocchi convoluzionali, due livelli di attenzione bidirezionale e un livello di pooling. Sono disponibili quattro versioni del modello, descritte in uno studio accessibile su arXiv con ID 2608.14658.
Fatti principali
- pico-type è un classificatore di contenuti multi-head a livello di byte con circa 1,5 milioni di parametri.
- Prevede simultaneamente sette proprietà del contenuto dai byte UTF-8 grezzi in una singola passata in avanti.
- Funziona senza tokenizer, vocabolario di sottoparole o embedding pre-addestrati.
- Classifica tipo grossolano (12 classi), modalità (8), sottotipo (24), linguaggio di codice (62), lingua testuale (30), tipo MIME del file (90) e flag di rischio (multi-etichetta a 6 etichette).
- L'architettura include un embedding di byte appreso, tre blocchi convoluzionali, due livelli di attenzione bidirezionale con codifiche posizionali rotatorie e un livello di pooling statistico.
- Utilizza sette teste di classificazione in stile Matryoshka.
- Quattro varianti a livelli (tiny/small/base/pro) condividono lo stesso tronco con rappresentazioni affettate da 16 a 576 dimensioni.
- L'articolo è disponibile su arXiv con identificatore 2608.14658.
Entità
Istituzioni
- arXiv