Pipeline LLM per la Raccolta di Dati sugli Ingredienti in Nutrizione Computazionale
Uno studio recente introduce una pipeline LLM meticolosamente controllata volta a raccogliere dati sugli ingredienti per la nutrizione computazionale. Questa pipeline impiega una solida stima statistica, controlli specifici del dominio e un metodo di fallback per il recupero web per affrontare problemi di database incompleti e incoerenti. Un esempio della Legge di Heap applicata a 233 ricette indica che la crescita degli ingredienti unici è sublineare e principalmente concentrata all'inizio, con il rapporto previsto di ingredienti unici per ricetta che diminuisce da 1,74 a 100 ricette a 0,19 a 5.000. Ogni attributo dell'ingrediente viene valutato attraverso query LLM ripetute, trattate come campioni da una distribuzione di risposte guidata dal modello, utilizzando stimatori puntuali robusti e punteggi di confidenza normalizzati su vari tipi di dati.
Fatti principali
- arXiv:2607.23273v1
- Tipo di annuncio: cross
- Abstract: La nutrizione computazionale necessita di dati precisi sugli ingredienti
- I database attuali sono incompleti, incoerenti e costruiti per riferimento umano
- Gli LLM potrebbero aiutare a colmare le lacune, ma gli output a passaggio singolo sono inaffidabili
- La pipeline include stima statistica robusta, controlli invarianti specifici del dominio e fallback di recupero web
- Legge di Heap adattata a 233 ricette
- Il rapporto previsto di ingredienti unici per ricetta scende da 1,74 a 100 ricette a 0,19 a 5.000
- Query LLM ripetute trattate come campioni da una distribuzione di risposte indotta dal modello
- Stimatori puntuali robusti e punteggi di confidenza normalizzati applicati
Entità
Istituzioni
- arXiv