ARTFEED — Contemporary Art Intelligence

Meta rilascia Muse Glimmer: modello AI multimodale open-source

ai-technology · 2026-08-10

Meta ha rilasciato Muse Glimmer, un modello AI multimodale denso da 30 miliardi di parametri, ora disponibile su Hugging Face Hub con supporto dal giorno zero in transformers, llama.cpp, vLLM e Inference Endpoints. Il modello combina un Perception Encoder da 2B in stile ViT per la visione con un decoder testuale da 28B, con attenzione ibrida che alterna strati a finestra scorrevole e strati di attenzione completa, Gated Grouped-Query Attention e normalizzazione Q-K. Supporta inferenza solo testuale, comprensione di immagini e video, chiamate di strumenti multimodali e rilevamento di oggetti. Muse Glimmer include anche un drafter opzionale di decodifica speculativa DFlash per una generazione più rapida, particolarmente per contenuti strutturati come codice. Il rilascio include supporto per il fine-tuning con TRL, e le dimostrazioni mostrano che il modello può quantizzarsi da solo, distribuirsi su Inference Endpoints e ottimizzare il proprio motore di inferenza per hardware specifici. Il modello fa parte della spinta di Meta verso l'AI locale e agente, ed è disponibile per l'uso con agenti di codifica come OpenClaw.

Fatti principali

  • Muse Glimmer è un modello denso da 30 miliardi di parametri con un Perception Encoder da 2B in stile ViT e un decoder testuale da 28B.
  • Utilizza attenzione ibrida: alterna strati a finestra scorrevole (2.048 token) e strati di attenzione completa, ripetuti 13 volte.
  • La Gated Grouped-Query Attention riduce la memoria della cache KV di 16 volte.
  • La normalizzazione Q-K con scaling aggiuntivo delle query stabilizza i logit di attenzione.
  • Il Perception Encoder gestisce sia immagini che video, dividendo in patch di 2 frame x 3 canali x 14 x 14.
  • I video vengono elaborati frame per frame, mirando a 2 frame al secondo e con un massimo di 96 frame.
  • Supporto dal giorno zero in transformers, llama.cpp, vLLM e Inference Endpoints.
  • Il drafter opzionale di decodifica speculativa DFlash accelera la generazione, specialmente per la codifica.
  • Esempi di fine-tuning con TRL sul dataset MolmoWeb e OpenCode con AsyncGRPO.
  • Muse Glimmer può quantizzarsi da solo, distribuirsi su Inference Endpoints e ottimizzare il proprio motore di inferenza.
  • OpenClaw può essere collegato a Muse Glimmer tramite un'API compatibile con OpenAI.
  • Il modello è disponibile su Hugging Face Hub.

Entità

Istituzioni

  • Meta
  • Hugging Face
  • transformers
  • llama.cpp
  • vLLM
  • Inference Endpoints
  • TRL
  • OpenClaw
  • DFlash
  • OpenCode
  • OpenEnv
  • MolmoWeb
  • VideoMME2
  • Hugging Face MCP
  • Gradio Space

Fonti