Qwen 3.8 27B: Potente LLM Open-Weight che Sovrapensa, Funziona in Locale
La recensione di Simon Willison di Qwen 3.8 27B, rilasciato il 16 agosto 2026 dal laboratorio di ricerca Qwen di Alibaba, evidenzia le sue impressionanti capacità ma nota uno sforzo di ragionamento predefinito 'extra alto' che porta a un consumo eccessivo di token. Il modello, un LLM con capacità visive da 27 miliardi di parametri con licenza Apache 2, mostra miglioramenti nei benchmark rispetto al suo predecessore Qwen 3.6 27B e al Qwen 3.7-Plus a pesi chiusi. Willison lo ha testato su un MacBook Pro M5 Max e su un NVIDIA DGX Spark utilizzando la build quantizzata Q4_K_M da 17 GB di LM Studio. Ha scoperto che lo sforzo di ragionamento predefinito faceva sì che il modello utilizzasse il limite di contesto di 8.192 token su compiti semplici, ma aumentando al contesto completo di 262.144 token si risolveva il problema. Un prompt per un SVG di un pellicano ha richiesto 21 minuti e 22.276 token di ragionamento, mentre disattivando il ragionamento ha prodotto un risultato in 137 secondi. Il modello ha anche eccelso nel rilevamento dei bounding box e ha costruito uno strumento HTML personalizzato da un singolo prompt. Willison lo ha testato come agente di codifica con Pi, convertendo con successo una trascrizione JSONL in markdown. Le prestazioni sono un punto critico: 15-30 token al secondo da LM Studio, più lente rispetto alle API ospitate. Tuttavia, il supporto per la Multi-Token Prediction (MTP), come suggerito dal creatore di llama.cpp Georgi Gerganov, ha aumentato le prestazioni di circa il 72% su Spark. La capacità del modello di funzionare su hardware consumer in un file da 17 GB dimostra un progresso significativo nei LLM locali, rendendo l'IA potente accessibile senza costosi hardware da datacenter.
Fatti principali
- Qwen 3.8 27B rilasciato il 16 agosto 2026 dal laboratorio di ricerca Qwen di Alibaba
- Licenza Apache 2, LLM con capacità visive da 27 miliardi di parametri
- Predefinito su uno sforzo di ragionamento 'extra alto', causando un'eccessiva riflessione
- I benchmark mostrano un miglioramento rispetto a Qwen 3.6 27B e Qwen 3.7-Plus
- Testato su MacBook Pro M5 Max e NVIDIA DGX Spark con LM Studio
- Utilizzata la build quantizzata Q4_K_M da 17 GB
- Il SVG del pellicano ha richiesto 21 minuti con ragionamento, 137 secondi senza
- Dimostrato il rilevamento dei bounding box e la creazione di strumenti
- Ciclo di agente di codifica con Pi riuscito
- L'ottimizzazione Multi-Token Prediction aumenta le prestazioni di circa il 72%
- Velocità dei token: 15-30 token al secondo da LM Studio
- Il modello si adatta in un file da 17 GB, funziona su hardware consumer
Entità
Artisti
- Simon Willison
Istituzioni
- Alibaba
- Qwen
- LM Studio
- NVIDIA
- OpenAI
- llama.cpp
- MLX