AI Observatory mette in luce le lacune nei rapporti aziendali sull'uso reale dell'IA
L'AI Observatory è stato fondato da ricercatori indipendenti per offrire un contrappunto ai dati delle aziende di IA come Anthropic e OpenAI. Questa piattaforma ha raccolto 24.521 interazioni di utenti provenienti da sette dataset, coinvolgendo 5.000 utenti e 52 modelli, tra cui Claude e ChatGPT, nel periodo 2023-2025. Co-diretto da Anka Reuel e Shayne Longpre, l'Osservatorio mira a fornire prove imparziali per il processo decisionale sull'IA. In particolare, i risultati indicano che l'Indice Economico di Anthropic esclude il 48% delle conversazioni che toccano argomenti più sensibili. L'uso dei modelli varia: Grok si concentra su notizie, Claude sulla programmazione e ChatGPT sui compiti accademici. Tuttavia, il dataset rimane modesto rispetto al milione di conversazioni analizzate da Anthropic e ai 1,5 milioni di OpenAI.
Fatti principali
- L'AI Observatory ha raccolto 24.521 conversazioni, 85.633 turni, 5.000 utenti e 52 modelli provenienti da sette dataset.
- Co-diretto da Anka Reuel (Stanford STAIR Lab) e Shayne Longpre (MIT Media Lab), con la collaborazione della Data Provenance Initiative.
- Applicando i metodi dell'Indice Economico di Anthropic al dataset dell'Osservatorio, verrebbe filtrato il 48% delle conversazioni.
- Le conversazioni filtrate presentavano livelli più elevati di contenuti sensibili: salute/relazioni 44,2% contro 31,2%, argomenti per adulti 7,9% contro 2,1%, molestie/odio 27,5% contro 5,66%, contenuti sessuali 16,7% contro 2,4%.
- Gli utenti di Grok erano orientati verso notizie e politica, con la disinformazione concentrata lì; Claude per la programmazione; Gemini per il gioco di ruolo; ChatGPT per i compiti a casa.
- Le conversazioni con GPT-4o erano più lunghe e più iterative rispetto a quelle con GPT-3.5, collegate a segnalazioni di dipendenza emotiva.
- Le interazioni sensibili sono diminuite nel tempo, suggerendo un miglioramento delle salvaguardie della piattaforma; sono aumentate le chiacchiere, mentre l'autodivulgazione dei chatbot è diminuita.
- L'Indice Economico di Anthropic ha analizzato 1 milione di conversazioni e il report di OpenAI su ChatGPT ha analizzato 1,5 milioni, superando di gran lunga le 24.521 dell'Osservatorio.
- Il dataset dell'Osservatorio è fornito volontariamente, probabilmente sottorappresentando gli usi sensibili, quindi i risultati non sono indicativi di tutto l'uso dell'IA.
- Anthropic ha riconosciuto l'importanza della ricerca esterna indipendente; OpenAI e xAI non hanno risposto alle richieste di commento.
Entità
Artisti
- Anka Reuel
- Shayne Longpre
- David Widder
Istituzioni
- AI Observatory
- Stanford Trustworthy AI Research (STAIR) Lab
- MIT Media Lab
- Data Provenance Initiative
- Anthropic
- OpenAI
- xAI
- UT-Austin's School of Information