Liquid AI presenta LFM2.5-VL-3B: modello visione-linguaggio per edge con comprensione avanzata degli schermi e uso di strumenti
Liquid AI ha introdotto LFM2.5-VL-3B, un modello visione-linguaggio progettato per la distribuzione edge che migliora la comprensione di schermi e interfacce utente, il grounding, l'input multi-immagine e la chiamata di funzioni. Questo modello integra un encoder visivo SigLIP2 400M NaFlex con il backbone LFM2.5-2.6B, addestrato su ben 34 trilioni di token e utilizzando quattro volte più dati visivi rispetto alle iterazioni precedenti. La fase di post-addestramento ha incluso fine-tuning supervisionato, distillazione della conoscenza, addestramento Antidoom e apprendimento per rinforzo multi-ricompensa. I test di benchmark rivelano le sue forti prestazioni nella comprensione visiva multilingue, nella comprensione di documenti e nel rilevamento di oggetti, rivaleggiando con Gemma-4-E2B e Qwen3.5-2B nell'utilizzo di strumenti. Elabora a 228 token/s su M5 Max, 116 token/s su Ryzen AI Max+ 395 e 20 token/s su Galaxy S26 Ultra, raggiungendo un output di concorrenza elevata di 11K token/s su GPU. Il modello è accessibile su Hugging Face e supporta llama.cpp, MLX, vLLM, SGLang e ONNX.
Fatti principali
- LFM2.5-VL-3B è un modello visione-linguaggio per la distribuzione edge.
- Migliora la comprensione di schermi/interfacce utente, il grounding, l'input multi-immagine e la chiamata di funzioni.
- Utilizza l'encoder visivo SigLIP2 400M NaFlex con il backbone LFM2.5-2.6B.
- Pre-addestrato su ~34T token con 4 volte più dati visivi.
- Il post-addestramento include SFT con distillazione della conoscenza e RL multi-ricompensa.
- Leader nella sua classe dimensionale su compiti di immagini reali ed eccelle nella lettura di documenti/schermi.
- Alla pari con Gemma-4-E2B e Qwen3.5-2B nei benchmark di utilizzo di strumenti.
- Velocità di inferenza: 228 tok/s su M5 Max, 116 tok/s su Ryzen AI Max+ 395, 20 tok/s su Galaxy S26 Ultra.
- Throughput GPU ~11K token/s, modelli di classe 4B 2 volte più grandi, ~1B token/giorno su H100.
- Disponibile su Hugging Face con supporto per llama.cpp, MLX, vLLM, SGLang, ONNX.
- Demo browser tramite WebGPU.
- Parte della visione di Liquid AI di un'IA che funziona ovunque.
Entità
Istituzioni
- Liquid AI
- Hugging Face