ARTFEED — Contemporary Art Intelligence

CoTinyVLA: Modello robotico con meno di un miliardo di parametri raggiunge il 90,8% su LIBERO-Plus

ai-technology · 2026-07-29

I ricercatori hanno sviluppato CoTinyVLA, un modello Visione-Linguaggio-Azione con 0,9 miliardi di parametri che raggiunge un'accuratezza del 90,8% sul benchmark di robustezza LIBERO-Plus. Il modello utilizza un backbone Qwen3.5-0.8B e impiega la distillazione della catena di pensiero da un modello insegnante da 35 miliardi di parametri. Elabora input temporali a doppia vista con 16 fotogrammi storici per passo e utilizza span CoT gerarchici per pianificazione e ragionamento. L'aumento tramite parafrasi espande 40 comandi base in 800 varianti. LIBERO-Plus include 10.030 compiti perturbati su sette dimensioni di perturbazione. Il lavoro affronta i vincoli di memoria nella robotica embedded strutturando la supervisione piuttosto che ingrandendo il modello.

Fatti principali

  • CoTinyVLA ha 0,9 miliardi di parametri
  • Utilizza il backbone Qwen3.5-0.8B
  • Raggiunge il 90,8% sul benchmark LIBERO-Plus
  • Distilla la catena di pensiero dal modello insegnante da 35 miliardi di parametri
  • Elabora 16 fotogrammi storici per passo con input temporale a doppia vista
  • Include span gerarchici Plan e Think
  • L'aumento tramite parafrasi espande 40 comandi in 800 varianti
  • LIBERO-Plus copre 10.030 compiti perturbati su 7 dimensioni

Entità

Istituzioni

  • arXiv

Fonti