ARTFEED — Contemporary Art Intelligence

Il Post-Addestramento Potenzia il Ragionamento Causale dei LLM, il Modello da 14B Supera GPT-4

ai-technology · 2026-08-06

Uno studio recente pubblicato su arXiv (2602.06337) esplora il potenziale del post-addestramento per migliorare i grandi modelli linguistici (LLM) come ragionatori causali. I ricercatori presentano CauGym, un ampio dataset che include sette compiti causali essenziali per l'addestramento e cinque diversi set di test. Valutano approfonditamente cinque diversi metodi di post-addestramento: SFT, DPO, KTO, PPO e GRPO. I risultati degli esperimenti su cinque compiti in-domain e quattro benchmark consolidati indicano che, con un adeguato post-addestramento, LLM più piccoli possono effettuare efficacemente inferenze causali, superando spesso modelli più grandi. Notevolmente, il loro modello con 14 miliardi di parametri raggiunge un'accuratezza del 93,5% sul benchmark CaLM, in contrasto con il modello o1 di OpenAI, che ottiene il 55,4%. Questa ricerca fa luce sugli effetti spesso trascurati del post-addestramento sulle capacità di stima causale, suggerendo la sua capacità di rendere il ragionamento AI avanzato più accessibile.

Fatti principali

  • Articolo su arXiv: 2602.06337
  • Introduce il dataset CauGym con sette compiti causali fondamentali
  • Valuta cinque metodi di post-addestramento: SFT, DPO, KTO, PPO, GRPO
  • Il modello da 14B parametri raggiunge un'accuratezza del 93,5% sul benchmark CaLM
  • OpenAI o1 raggiunge un'accuratezza del 55,4% sullo stesso benchmark
  • Il post-addestramento consente a LLM più piccoli di superare modelli più grandi nell'inferenza causale
  • Lo studio copre cinque benchmark in-domain e quattro esistenti
  • La ricerca affronta l'esplorazione limitata degli effetti del post-addestramento sul ragionamento causale

Entità

Istituzioni

  • arXiv
  • OpenAI

Fonti