OliveGemma: Un Modello Linguistico Visivo per il Riconoscimento della Dieta Mediterranea
È stato sviluppato un nuovo modello linguistico visivo chiamato OliveGemma per identificare e analizzare piatti mediterranei ed europei, affrontando le complessità del riconoscimento alimentare dettagliato nelle valutazioni dietetiche basate su immagini. Utilizzando il framework open-weight PaliGemma-2-3B, OliveGemma è stato ottimizzato tramite LoRA con un dataset consolidato di 17.340 immagini provenienti da tre iniziative di ricerca europee: MedGR, ODIN e VIPPSTAR. Questo modello integra questi dataset in 216 categorie di piatti distinte e include 102.642 coppie di domande-risposte di tipo istruttivo relative all'identificazione dei piatti, agli ingredienti, alle prove visive e alla comprensione complessiva del cibo. In un test di validazione incrociata a 3 fold, OliveGemma ha raggiunto un'accuratezza top-1 del 92,96% ± 0,91%, superando la baseline CNN leader (DensNet). I risultati, pubblicati come preprint arXiv 2608.03428, suggeriscono che i modelli linguistici visivi potrebbero servire come alternative efficaci ai diari alimentari tradizionali, migliorando le valutazioni dietetiche e la ricerca nutrizionale, specialmente nelle regioni mediterranee.
Fatti principali
- OliveGemma è un modello linguistico visivo per il riconoscimento della cucina mediterranea ed europea.
- È basato sull'architettura PaliGemma-2-3B e ottimizzato con LoRA.
- I dati di addestramento includono 17.340 immagini dai dataset MedGR, ODIN e VIPPSTAR.
- Il modello copre 216 categorie di piatti composte e 102.642 elementi di domande-risposte di tipo istruttivo.
- Raggiunge un'accuratezza top-1 del 92,96% ± 0,91%, superando le baseline CNN.
- Ha lo scopo di fornire un'alternativa scalabile ai diari alimentari auto-riportati.
- Pubblicato come preprint arXiv 2608.03428.
- Supporta il riconoscimento dei piatti, l'identificazione degli ingredienti e la discriminazione dei confini di classe.
Entità
Istituzioni
- arXiv