COMEX: Nuovo Benchmark e Framework per il Ritaglio Estetico delle Immagini Spiegabile
Un nuovo studio ha introdotto COMEX, un framework e benchmark progettato per rendere il ritaglio estetico delle immagini più comprensibile. Disponibile su arXiv (2608.07570), reimmagina il compito di ritaglio come una sfida strutturata che considera sia la composizione che le spiegazioni, affrontando i difetti dei metodi esistenti che si concentrano principalmente sulla generazione di testo a posteriori. COMEX include 33.161 quadruple, ciascuna contenente un'immagine espansa, una scatola di ritaglio, una categoria per la composizione e una spiegazione motivata. Il framework consente l'apprendimento congiunto nella localizzazione del ritaglio, nella comprensione della composizione e nella generazione di spiegazioni. Gli autori suggeriscono un metodo in due fasi, SFT+GRPO, che inizia con il fine-tuning supervisionato e prosegue con l'ottimizzazione della policy relativa al gruppo per migliorare la qualità delle spiegazioni, facendo avanzare significativamente i campi dell'estetica computazionale e della visione artificiale.
Fatti principali
- COMEX è un nuovo benchmark per il ritaglio estetico delle immagini spiegabile.
- Contiene 33.161 quadruple, ciascuna con un'immagine espansa, una scatola di ritaglio, una categoria di composizione e una spiegazione.
- Il benchmark è costruito tramite espansione dell'immagine e un pipeline di inversione IO.
- Il framework proposto utilizza un approccio in due fasi SFT+GRPO.
- L'articolo è disponibile su arXiv con identificativo 2608.07570.
- Il lavoro riformula il ritaglio spiegabile come un problema strutturato di ritaglio-composizione-spiegazione.
- Consente l'apprendimento congiunto della localizzazione del ritaglio, della comprensione della composizione e della generazione di spiegazioni.
- L'approccio affronta i limiti dei metodi di spiegazione post-hoc esistenti.
Entità
Istituzioni
- arXiv