TangPoetryBench: Nuovo Benchmark per la Valutazione della Generazione di Immagini da Poesia
I ricercatori hanno introdotto TangPoetryBench, un benchmark multidimensionale progettato per valutare i modelli text-to-image (T2I) sulla loro capacità di illustrare la poesia classica cinese Tang. Il benchmark comprende 1.280 immagini generate da 320 poesie utilizzando quattro modelli T2I all'avanguardia, accompagnate da annotazioni umane controllate per qualità su dieci dimensioni. Lo studio affronta i limiti delle metriche esistenti come CLIPScore, BLIPScore e VQAScore, che misurano solo la corrispondenza letterale testo-immagine e non riescono a catturare i requisiti sfumati dell'illustrazione poetica, inclusa la solidità visiva, la fedeltà all'immaginario e alla scena, l'appropriatezza culturale e stilistica, l'assenza di testo spurio e la verità emotiva. L'analisi rivela punti di forza e debolezza condivisi e specifici del modello, fornendo approfondimenti sulle attuali capacità dei modelli T2I nel rendere contenuti letterari e culturali. L'articolo è disponibile su arXiv con l'identificatore 2608.11452.
Fatti principali
- TangPoetryBench include 1.280 immagini generate da 320 poesie classiche cinesi Tang.
- Quattro modelli T2I all'avanguardia sono stati utilizzati per generare le immagini.
- Le annotazioni umane coprono dieci dimensioni di valutazione.
- Le metriche esistenti come CLIPScore, BLIPScore e VQAScore sono inadeguate per l'illustrazione poetica.
- Il benchmark valuta la solidità visiva, la fedeltà, l'appropriatezza culturale e la verità emotiva.
- Lo studio identifica punti di forza e debolezza condivisi e specifici del modello.
- L'articolo è disponibile su arXiv (2608.11452).
- Il compito dell'illustrazione poetica è multiforme e include emozioni implicite.
Entità
Istituzioni
- arXiv