ARTFEED — Contemporary Art Intelligence

FAS-R1: Un MLLM Multi-task Unificato per il Face Anti-Spoofing Ragionato

ai-technology · 2026-07-30

Un nuovo framework chiamato FAS-R1 è stato introdotto dai ricercatori, progettato come un modello linguistico multimodale di grandi dimensioni (MLLM) orientato al ragionamento in due fasi per la previsione completa del face anti-spoofing (FAS). Questo framework include compiti come la classificazione dell'autenticità, l'identificazione del tipo di attacco e la localizzazione della regione spoof. Inizialmente, impiega FAS-R1-23K, un dataset di alta qualità per il fine-tuning supervisionato a freddo, seguito da un post-training GRPO specifico per FAS. L'Augmentation Simulata del Degrado (DSA) promuove un ragionamento stabile degli indizi di spoof in mezzo a variazioni della qualità visiva, mentre il Difficulty-Aware GRPO (DA-GRPO) aiuta a ridurre il dominio dei campioni facili. Questa iniziativa affronta la necessità per i sistemi FAS di fornire non solo determinazioni genuine/spoof ma anche semantica degli attacchi e prove basate sull'immagine per la revisione umana.

Fatti principali

  • FAS-R1 è un framework MLLM orientato al ragionamento in due fasi per la previsione FAS unificata.
  • Copre la classificazione dell'autenticità, il riconoscimento del tipo di attacco e la localizzazione della regione spoof.
  • La prima fase utilizza il dataset FAS-R1-23K per il fine-tuning supervisionato a freddo.
  • La seconda fase esegue un post-training GRPO specifico per FAS.
  • DSA incoraggia un ragionamento stabile attraverso variazioni della qualità visiva.
  • DA-GRPO mitiga il dominio dei campioni facili.
  • Affronta la necessità di semantica degli attacchi e prove basate sull'immagine.
  • Pubblicato su arXiv con ID 2607.26432.

Entità

Istituzioni

  • arXiv

Fonti