Documenti desecretati: un dirigente Microsoft ha definito lo scraping per l'IA 'il più grande furto di lavoro nella storia umana'
Documenti giudiziari recentemente desecretati relativi alla causa per violazione del copyright del New York Times contro OpenAI e Microsoft rivelano che lo scraping dei dati di addestramento dell'IA costituisce un furto e rappresenta un rischio significativo per la sostenibilità degli editori. Brent Hecht di Microsoft ha caratterizzato la questione in un memo del gennaio 2023 come 'un furto sconcertante'. Le prove indicano che Copilot di Microsoft ha portato a una diminuzione dei tassi di clic su nytimes.com fino al 93%. Il CEO Satya Nadella ha dichiarato che i contenuti dietro paywall dovrebbero essere concessi in licenza, mentre Nick Turley di OpenAI ha messo in guardia da una 'minaccia esistenziale' per gli editori. Le accuse includono l'aggiramento dei paywall e l'inclusione di oltre 91.692 copie di materiali del NYT nei dataset di addestramento. L'amministrazione Trump ha recentemente sostenuto l'addestramento senza licenza di OpenAI come fair use. Né OpenAI né Microsoft hanno fornito commenti.
Fatti principali
- Documenti desecretati nel caso The New York Times contro OpenAI e Microsoft rivelano ammissioni interne sullo scraping dei dati di addestramento dell'IA.
- Brent Hecht, direttore di scienze applicate di Microsoft, ha definito lo scraping per l'IA 'il più grande furto di lavoro nella storia umana' in un memo del gennaio 2023.
- I dati di Microsoft mostrano che Copilot ha ridotto i tassi di clic su nytimes.com fino al 93% rispetto alla ricerca Bing.
- Il CEO di Microsoft Satya Nadella ha testimoniato che i contenuti dietro paywall dovrebbero essere concessi in licenza e che avrebbe richiesto a OpenAI di riaddestrare i modelli se fosse stato a conoscenza dello scraping dei paywall.
- Nick Turley, responsabile di ChatGPT di OpenAI, ha descritto una 'minaccia esistenziale' per gli editori derivante da prodotti chatbot sostitutivi.
- I dataset di addestramento intermedi di OpenAI contenevano oltre 91.692 copie di opere del The New York Times, del Daily News e del Center for Investigative Reporting.
- Un dataset derivato da Common Crawl includeva più di 2 milioni di documenti da nytimes.com.
- Il documento allegato sostiene l'aggiramento deliberato dei paywall e la rimozione degli avvisi di copyright dai dati di addestramento.
Entità
Artisti
- Brent Hecht
- Satya Nadella
- Nick Turley
- Greg Brockman
- Nick Ryder
- Donald Trump
Istituzioni
- Microsoft
- OpenAI
- The New York Times
- Daily News
- Center for Investigative Reporting
- Common Crawl
- Trump administration
- Bing
- Copilot
- ChatGPT
- News Orgs
Luoghi
- United States