CoTinyVLA: Modello robotico con meno di un miliardo di parametri raggiunge il 90,8% su LIBERO-Plus
I ricercatori hanno sviluppato CoTinyVLA, un modello Visione-Linguaggio-Azione con 0,9 miliardi di parametri che raggiunge un'accuratezza del 90,8% sul benchmark di robustezza LIBERO-Plus. Il modello utilizza un backbone Qwen3.5-0.8B e impiega la distillazione della catena di pensiero da un modello insegnante da 35 miliardi di parametri. Elabora input temporali a doppia vista con 16 fotogrammi storici per passo e utilizza span CoT gerarchici per pianificazione e ragionamento. L'aumento tramite parafrasi espande 40 comandi base in 800 varianti. LIBERO-Plus include 10.030 compiti perturbati su sette dimensioni di perturbazione. Il lavoro affronta i vincoli di memoria nella robotica embedded strutturando la supervisione piuttosto che ingrandendo il modello.
Fatti principali
- CoTinyVLA ha 0,9 miliardi di parametri
- Utilizza il backbone Qwen3.5-0.8B
- Raggiunge il 90,8% sul benchmark LIBERO-Plus
- Distilla la catena di pensiero dal modello insegnante da 35 miliardi di parametri
- Elabora 16 fotogrammi storici per passo con input temporale a doppia vista
- Include span gerarchici Plan e Think
- L'aumento tramite parafrasi espande 40 comandi in 800 varianti
- LIBERO-Plus copre 10.030 compiti perturbati su 7 dimensioni
Entità
Istituzioni
- arXiv