GAM-Agent: framework multi-agente basato sulla teoria dei giochi migliora il ragionamento visione-linguaggio
Un nuovo framework multi-agente chiamato GAM-Agent è stato sviluppato da ricercatori per migliorare il ragionamento visione-linguaggio. A differenza dei modelli precedenti che si affidano a un singolo agente, GAM-Agent affronta il ragionamento come un gioco a somma non zero, coinvolgendo agenti di base che si concentrano su specifici compiti di percezione visiva e un agente chiave responsabile di garantire coerenza logica e accuratezza fattuale. Questi agenti scambiano affermazioni strutturate, prove e valutazioni di incertezza. Un controller adattivo risponde a disaccordi o ambiguità avviando discussioni multi-round, ottenendo risultati più affidabili e interpretabili. I test su quattro benchmark impegnativi—MMMU, MMBench, MVBench e V*Bench—mostrano che GAM-Agent supera significativamente vari modelli di base visione-linguaggio (VLM), migliorando in particolare l'accuratezza di modelli più piccoli come Qwen2.5-VL-7B e InternVL2.5-8B, raggiungendo risultati pari o superiori a quelli di modelli più grandi. Questo framework basato sulla teoria dei giochi presenta una nuova strategia per avanzare il ragionamento dell'IA, con implicazioni promettenti per sfide di ragionamento visivo complesse.
Fatti principali
- GAM-Agent è un framework multi-agente basato sulla teoria dei giochi per il ragionamento visione-linguaggio.
- Modella il ragionamento come un gioco a somma non zero tra agenti di base e un agente critico.
- Gli agenti comunicano tramite affermazioni strutturate, prove e stime di incertezza.
- Un controller sensibile all'incertezza regola dinamicamente la collaborazione e attiva dibattiti.
- Testato sui benchmark MMMU, MMBench, MVBench e V*Bench.
- Migliora le prestazioni su vari modelli di base VLM.
- Aumenta l'accuratezza di modelli di piccola e media scala come Qwen2.5-VL-7B e InternVL2.5-8B.
- Pubblicato su arXiv con ID 2505.23399.
Entità
Istituzioni
- arXiv