Diagram-MMU: Nuovo Benchmark Testa la Parsing dei Diagrammi Scientifici da parte dell'IA
Un nuovo benchmark chiamato Diagram-MMU è stato lanciato da ricercatori per valutare i Modelli Linguistici Multimodali di Grandi Dimensioni (MLLM) nell'ambito dell'interpretazione e dell'analisi di diagrammi scientifici. Questo benchmark include 3.700 diagrammi accuratamente selezionati e 18.300 domande validate da esseri umani in sei diversi campi. Valuta i modelli attraverso tre compiti specifici: parsing dei diagrammi in codice, modifica del codice derivato dai diagrammi e risposta a domande relative ai diagrammi, il tutto in contesti agentici. Un'analisi di 12 MLLM ha indicato che i compiti che coinvolgono la conversione da diagramma a codice sono più complessi del rispondere a domande relative ai diagrammi, suggerendo che mentre i modelli possono analizzare i diagrammi, trovano più difficile il parsing e la modifica. Il benchmark nasce dalla crescente applicazione degli MLLM nella documentazione scientifica, esemplificata da OpenAI Prism, che traduce i diagrammi in codice LaTeX TikZ. Questi risultati evidenziano la necessità di migliorare le funzionalità di conversione da diagramma a codice.
Fatti principali
- Diagram-MMU è un nuovo benchmark multimodale per diagrammi scientifici.
- Include 3.700 diagrammi curati e 18.300 domande validate da esseri umani.
- Il benchmark copre sei domini.
- Valuta tre compiti: parsing da diagramma a codice, modifica da diagramma a codice e risposta a domande sui diagrammi.
- Sono stati valutati 12 MLLM.
- I compiti da diagramma a codice sono più impegnativi del rispondere a domande sui diagrammi.
- OpenAI Prism è menzionato come spazio di lavoro per la scrittura scientifica.
- L'articolo è disponibile su arXiv (2608.12262).
Entità
Istituzioni
- OpenAI
- arXiv