未塗黑文件曝光:微軟高層私下形容 AI 爬取為「人類史上最大規模的盜取勞動」

《紐約時報》三年前控告 OpenAI 及微軟侵犯版權的訴訟中,最新未塗黑文件揭示多項內部陳述:一名微軟高層私下形容兩間公司的 AI 訓練做法為「盜竊」,而 OpenAI 管理層亦承認其人工智能模型對出版商及記者構成「存亡威脅」。這些作品正是訓練模型的材料。[1]

繞過付費牆與移除版權聲明

文件亦詳細描述兩間公司如何被指取得及使用該些內容:繞過付費牆而不被偵測、透過大規模爬取建立訓練數據集,以及故意從訓練數據中移除版權聲明。[1]

其中一項關鍵數據來自微軟本身:其 Copilot「答案引擎」令《紐約時報》域名的點擊率,較傳統 Bing 搜尋最多下跌九成三。微軟應用科學總監 Brent Hecht 在2024年1月的內部簡報中形容這個跌勢為「末日循環」,並指它會同時損害模型效能與整個網絡。該文件直言,終端產品威脅其關鍵供應商的經濟基礎是極不尋常的情況,但這正是其大型語言模型業務在「內容供應鏈」上造成的局面。

高層證詞與內部通訊

微軟行政總裁 Satya Nadella 今年在宣誓作證時表示,任何受付費牆保護的內容都應由使用者取得授權,並表明若他知悉 OpenAI 曾爬取及訓練付費牆後的資訊,他會行使權利要求 OpenAI 重新訓練模型。

OpenAI 的 ChatGPT 主管 Nick Turley 在內部通訊中寫道,出版商面對來自聊天機械人的存亡威脅,因為該產品「大致上具替代性」,並且「隨著變得更好會越來越具替代性」。OpenAI 總裁 Greg Brockman 則形容模型「極擅長新聞」。Nadella 亦在宣誓下同意,與聊天機械人對話已「替代」了前往原始網站取得資訊的需要。

一份微軟文件指出,生成式人工智能存在「真實風險」,可能嚴重擾亂那些生成訓練數據者的就業。

複製規模

文件的規模令人震驚。資料首次揭示,單是 OpenAI 的中期訓練數據集,就含有超過91,692份由《紐約時報》、《每日新聞》及調查報道中心出版的作品副本;一個源自 Common Crawl 的數據集,則含有超過200萬份來自 nytimes.com 的文件。

法律背景

這份未塗黑的文件是該宗三年訴訟的最新升級。案件的核心問題——人工智能公司能否合法使用版權材料訓練模型——至今沒有明確答案,但法官大致上傾向接受 AI 公司關於訓練構成「合理使用」的論點。本月初,特朗普政府就提交意見書,為 OpenAI 未經授權使用版權材料訓練模型辯護。[2]

然而,多項新披露的陳述與 OpenAI 的合理使用抗辯相牴觸,特別是該原則要求使用不得替代或損害原作品市場。

值得注意的是,大部分新資訊來自《紐約時報》本身的意見書,而非仍被封存的基礎證物,因此上述引述均脫離了原本的上下文。

參考資料

[1] TechCrunch — Microsoft exec called AI scraping ‘the largest theft of labor in human history,’ new unredacted filings reveal

[2] TechCrunch — U.S. government sides with OpenAI on issue of training LLMs on copyrighted material

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

*