Anthropic e OpenAI propongono l'integrazione di valutatori indipendenti per la sicurezza, ma i dettagli restano poco chiari
Dario Amodei, CEO di Anthropic, ha suggerito che valutatori indipendenti dovrebbero essere integrati nelle principali aziende di intelligenza artificiale per monitorare incidenti di sicurezza e valutare l'allineamento dei modelli. Anthropic consentirà a organizzazioni come METR e Redwood Research di accedere ai propri sistemi, con il sostegno del CEO di OpenAI, Sam Altman. Questi valutatori mirano ad ottenere accesso ai checkpoint intermedi di addestramento e a condurre interviste con i dipendenti. Adam Gleave di FAR.AI ha osservato che ciò potrebbe portare alla luce comportamenti preoccupanti, mentre Alexander Meinke di Apollo Research ha sottolineato l'importanza di verificare l'allineamento dell'IA. I dettagli sui valutatori e sul loro accesso non sono stati resi noti da Anthropic o OpenAI. Le leggi californiane SB 53 e SB 813 richiedono quadri di sicurezza e controlli indipendenti, mentre l'AI Act dell'UE impone valutazioni dei modelli. La proposta di Amodei va oltre le normative esistenti.
Fatti principali
- Il CEO di Anthropic, Dario Amodei, ha proposto l'integrazione di valutatori indipendenti all'interno di tutte le aziende di IA all'avanguardia in un saggio pubblicato nel fine settimana.
- Anthropic si è impegnata a concedere a valutatori indipendenti come METR e Redwood Research un accesso senza precedenti ai propri sistemi.
- Il CEO di OpenAI, Sam Altman, ha dichiarato che anche OpenAI si impegnerà in questa pratica.
- I valutatori desiderano accesso ai checkpoint intermedi di addestramento, agli ambienti post-addestramento, ai trascritti delle valutazioni e alle interviste con i dipendenti.
- Né Anthropic né OpenAI hanno reso noto con quali valutatori collaboreranno, quando saranno integrati, quanti saranno, a quali sistemi potranno accedere o cosa potrà essere divulgato pubblicamente.
- Durante l'incidente di Hugging Face, OpenAI ha concesso a METR e Redwood circa una settimana in sede per indagare.
- Per GPT-6 Astra, ad Apollo Research sono stati concessi solo tre giorni per testare il modello.
- La legge californiana SB 53 richiede ai grandi sviluppatori di IA all'avanguardia di pubblicare quadri di sicurezza e segnalare incidenti critici di sicurezza.
- La legge californiana SB 813 crea un quadro per organizzazioni di verifica indipendenti riconosciute dallo stato.
- L'AI Act dell'UE richiede agli sviluppatori all'avanguardia di condurre e documentare valutazioni dei modelli e test adversariali e di segnalare incidenti gravi.
Entità
Artisti
- Dario Amodei
- Sam Altman
- Alexander Meinke
- Adam Gleave
- John Steidley
- Henry Papadatos
- Demis Hassabis
- Jacob Coxon
- Brian Merchant
- Elon Musk
- Evan Hubinger
- Donald Trump
- Kevin Hassett
- Chris Lehane
- David Sacks
- Daniela Amodei
Istituzioni
- Anthropic
- OpenAI
- METR
- Redwood Research
- TechCrunch
- Apollo Research
- FAR.AI
- Palisade Research
- Safer AI
- Meta
- SpaceXAI
- Google DeepMind
- EU AI Office
- Volkswagen
- HuggingFace
- US government
- xAI
- All-In Summit
- CNBC
- Truth Social
- X
- National Economic Council
- Chinese Foreign Ministry
- White House
- Bloomberg
- Fortune
- The Information
- U.S. government
- FRONTIER Act
- Google-DeepMind
- Freitag
Luoghi
- California
- United States
- Europe
- China
- Germany
- Los Angeles
- Washington
- Vereinigte Staaten
Fonti
- TechCrunch AI —
- Quartz —
- TechCrunch AI —
- der Freitag —
- SCMP Culture —
- TechCrunch AI —