ARTFEED — Contemporary Art Intelligence

Anthropic e OpenAI propongono l'integrazione di valutatori indipendenti per la sicurezza, ma i dettagli restano poco chiari

ai-technology · 2026-09-12

Dario Amodei, CEO di Anthropic, ha suggerito che valutatori indipendenti dovrebbero essere integrati nelle principali aziende di intelligenza artificiale per monitorare incidenti di sicurezza e valutare l'allineamento dei modelli. Anthropic consentirà a organizzazioni come METR e Redwood Research di accedere ai propri sistemi, con il sostegno del CEO di OpenAI, Sam Altman. Questi valutatori mirano ad ottenere accesso ai checkpoint intermedi di addestramento e a condurre interviste con i dipendenti. Adam Gleave di FAR.AI ha osservato che ciò potrebbe portare alla luce comportamenti preoccupanti, mentre Alexander Meinke di Apollo Research ha sottolineato l'importanza di verificare l'allineamento dell'IA. I dettagli sui valutatori e sul loro accesso non sono stati resi noti da Anthropic o OpenAI. Le leggi californiane SB 53 e SB 813 richiedono quadri di sicurezza e controlli indipendenti, mentre l'AI Act dell'UE impone valutazioni dei modelli. La proposta di Amodei va oltre le normative esistenti.

Fatti principali

  • Il CEO di Anthropic, Dario Amodei, ha proposto l'integrazione di valutatori indipendenti all'interno di tutte le aziende di IA all'avanguardia in un saggio pubblicato nel fine settimana.
  • Anthropic si è impegnata a concedere a valutatori indipendenti come METR e Redwood Research un accesso senza precedenti ai propri sistemi.
  • Il CEO di OpenAI, Sam Altman, ha dichiarato che anche OpenAI si impegnerà in questa pratica.
  • I valutatori desiderano accesso ai checkpoint intermedi di addestramento, agli ambienti post-addestramento, ai trascritti delle valutazioni e alle interviste con i dipendenti.
  • Né Anthropic né OpenAI hanno reso noto con quali valutatori collaboreranno, quando saranno integrati, quanti saranno, a quali sistemi potranno accedere o cosa potrà essere divulgato pubblicamente.
  • Durante l'incidente di Hugging Face, OpenAI ha concesso a METR e Redwood circa una settimana in sede per indagare.
  • Per GPT-6 Astra, ad Apollo Research sono stati concessi solo tre giorni per testare il modello.
  • La legge californiana SB 53 richiede ai grandi sviluppatori di IA all'avanguardia di pubblicare quadri di sicurezza e segnalare incidenti critici di sicurezza.
  • La legge californiana SB 813 crea un quadro per organizzazioni di verifica indipendenti riconosciute dallo stato.
  • L'AI Act dell'UE richiede agli sviluppatori all'avanguardia di condurre e documentare valutazioni dei modelli e test adversariali e di segnalare incidenti gravi.

Entità

Artisti

Istituzioni

  • Anthropic
  • OpenAI
  • METR
  • Redwood Research
  • TechCrunch
  • Apollo Research
  • FAR.AI
  • Palisade Research
  • Safer AI
  • Meta
  • SpaceXAI
  • Google DeepMind
  • Google
  • EU AI Office
  • Volkswagen
  • HuggingFace
  • US government
  • xAI
  • All-In Summit
  • CNBC
  • Truth Social
  • X
  • National Economic Council
  • Chinese Foreign Ministry
  • White House
  • Bloomberg
  • Fortune
  • The Information
  • U.S. government
  • FRONTIER Act
  • Google-DeepMind
  • Freitag

Luoghi

  • California
  • United States
  • Europe
  • China
  • Germany
  • Los Angeles
  • Washington
  • Vereinigte Staaten

Fonti