TutorMoments: I tutor AI faticano a bilanciare aiuto e indipendenza
L'Allen Institute for AI (AI2) ha introdotto TutorMoments, un nuovo framework e dataset volto a valutare i modelli linguistici di grandi dimensioni (LLM) in un contesto di tutoraggio. Questa iniziativa utilizza 462 trascrizioni anonime di sessioni individuali di tutoraggio di matematica per studenti statunitensi dal 2° al 7° grado, raccolte da un programma ad alta intensità rivolto a scuole Title I. I punti decisionali chiave per i tutor sono annotati da 27 educatori di matematica. In TutorMoments, gli LLM hanno il compito di fare da tutor per cinque turni durante questi momenti critici, valutati in base a scaffolding, rigore e over-scaffolding. Il test di sette LLM rivela una tendenza a fornire un'assistenza eccessiva con prompt di base, mentre i prompt sensibili alla valutazione migliorano le loro prestazioni. Sebbene i tutor umani abbiano ottenuto punteggi inferiori rispetto agli LLM, forniscono un benchmark naturalistico. Il progetto presenta anche il dataset TutorMoments-Preview e ha piani di espansione futura.
Fatti principali
- 1. TutorMoments è un framework per valutare la capacità degli LLM di bilanciare l'aiuto e il trattenersi nel tutoraggio.
- 2. Il dataset include 462 trascrizioni de-identificate di sessioni reali di tutoraggio di matematica con studenti statunitensi dal 2° al 7° grado.
- 3. 27 insegnanti di matematica esperti con sede negli Stati Uniti hanno annotato oltre 1.500 momenti chiave.
- 4. Le trascrizioni provengono da un programma di tutoraggio ad alta intensità che serve principalmente scuole Title I.
- 5. Sette LLM sono stati testati utilizzando due prompt: semplice e sensibile alla valutazione.
- 6. I modelli tendono a fornire un aiuto eccessivo quando viene data solo l'istruzione di 'fare da tutor bene'.
- 7. Il prompt sensibile alla valutazione migliora le prestazioni ma non colma il divario con il tutoraggio umano.
- 8. I tutor umani hanno ottenuto punteggi di 0,458 (scaffolding appropriato), 0,182 (rigore appropriato) e 0,496 (evita l'over-scaffolding).
- 9. Il progetto è sostenuto dalla Gates Foundation e da Learning Commons.
- 10. Il team prevede di costruire un dataset multimodale più ampio e una pipeline di punteggio più robusta.
Entità
Istituzioni
- Allen Institute for AI (AI2)
- Gates Foundation
- Learning Commons
- Hugging Face
Luoghi
- United States