---
title: "未塗黑文件曝光：微軟高層私下形容 AI 爬取為「人類史上最大規模的盜取勞動」"
url: https://sammy.hk/%e6%9c%aa%e5%a1%97%e9%bb%91%e6%96%87%e4%bb%b6%e6%9b%9d%e5%85%89%ef%bc%9a%e5%be%ae%e8%bb%9f%e9%ab%98%e5%b1%a4%e7%a7%81%e4%b8%8b%e5%bd%a2%e5%ae%b9-ai-%e7%88%ac%e5%8f%96%e7%82%ba%e3%80%8c%e4%ba%ba/
author: Ethan
published: 2026-09-18T13:52:00+08:00
modified: 2026-09-18T13:52:00+08:00
description: "《紐約時報》三年前控告 OpenAI 及微軟侵犯版權的訴訟中，最新未塗黑文件揭示多項內部陳述：一名微軟高層私下形容兩間公司的 AI 訓練做法為「盜竊」，而 OpenAI 管理層亦承認其人工智能模型對出版商及記者構成「存亡威脅」。這些作品正是訓練模型的材料。[1] 繞過付費牆與移除版權聲明 文件亦詳細描述兩間公司如何被指…"
categories: [AI]
tags: ["AI爬取", OpenAI, "微軟", "版權訴訟", "紐約時報"]
source: https://sammy.hk
---
《紐約時報》三年前控告 OpenAI 及微軟侵犯版權的訴訟中，最新未塗黑文件揭示多項內部陳述：一名微軟高層私下形容兩間公司的 AI 訓練做法為「盜竊」，而 OpenAI 管理層亦承認其人工智能模型對出版商及記者構成「存亡威脅」。這些作品正是訓練模型的材料。\[1\]

## 繞過付費牆與移除版權聲明

文件亦詳細描述兩間公司如何被指取得及使用該些內容：繞過付費牆而不被偵測、透過大規模爬取建立訓練數據集，以及故意從訓練數據中移除版權聲明。\[1\]

其中一項關鍵數據來自微軟本身：其 Copilot「答案引擎」令《紐約時報》域名的點擊率，較傳統 Bing 搜尋最多下跌九成三。微軟應用科學總監 Brent Hecht 在2024年1月的內部簡報中形容這個跌勢為「末日循環」，並指它會同時損害模型效能與整個網絡。該文件直言，終端產品威脅其關鍵供應商的經濟基礎是極不尋常的情況，但這正是其大型語言模型業務在「內容供應鏈」上造成的局面。

## 高層證詞與內部通訊

微軟行政總裁 Satya Nadella 今年在宣誓作證時表示，任何受付費牆保護的內容都應由使用者取得授權，並表明若他知悉 OpenAI 曾爬取及訓練付費牆後的資訊，他會行使權利要求 OpenAI 重新訓練模型。

OpenAI 的 ChatGPT 主管 Nick Turley 在內部通訊中寫道，出版商面對來自聊天機械人的存亡威脅，因為該產品「大致上具替代性」，並且「隨著變得更好會越來越具替代性」。OpenAI 總裁 Greg Brockman 則形容模型「極擅長新聞」。Nadella 亦在宣誓下同意，與聊天機械人對話已「替代」了前往原始網站取得資訊的需要。

一份微軟文件指出，生成式人工智能存在「真實風險」，可能嚴重擾亂那些生成訓練數據者的就業。

## 複製規模

文件的規模令人震驚。資料首次揭示，單是 OpenAI 的中期訓練數據集，就含有超過91,692份由《紐約時報》、《每日新聞》及調查報道中心出版的作品副本；一個源自 Common Crawl 的數據集，則含有超過200萬份來自 nytimes.com 的文件。

## 法律背景

這份未塗黑的文件是該宗三年訴訟的最新升級。案件的核心問題——人工智能公司能否合法使用版權材料訓練模型——至今沒有明確答案，但法官大致上傾向接受 AI 公司關於訓練構成「合理使用」的論點。本月初，特朗普政府就提交意見書，為 OpenAI 未經授權使用版權材料訓練模型辯護。\[2\]

然而，多項新披露的陳述與 OpenAI 的合理使用抗辯相牴觸，特別是該原則要求使用不得替代或損害原作品市場。

值得注意的是，大部分新資訊來自《紐約時報》本身的意見書，而非仍被封存的基礎證物，因此上述引述均脫離了原本的上下文。

## 參考資料

\[1\] [TechCrunch — Microsoft exec called AI scraping ‘the largest theft of labor in human history,’ new unredacted filings reveal](https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal)

\[2\] [TechCrunch — U.S. government sides with OpenAI on issue of training LLMs on copyrighted material](https://techcrunch.com/2026/09/02/u-s-government-sides-with-openai-on-issue-of-training-llms-on-copyrighted-material/)

### 相關文章：

1. [OpenAI 公開 Astra 細節：首個達「關鍵網絡安全門檻」的模型，能力驚人但限制更多](https://sammy.hk/openai-%e5%85%ac%e9%96%8b-astra-%e7%b4%b0%e7%af%80%ef%bc%9a%e9%a6%96%e5%80%8b%e9%81%94%e3%80%8c%e9%97%9c%e9%8d%b5%e7%b6%b2%e7%b5%a1%e5%ae%89%e5%85%a8%e9%96%80%e6%aa%bb%e3%80%8d%e7%9a%84%e6%a8%a1/ "OpenAI 公開 Astra 細節：首個達「關鍵網絡安全門檻」的模型，能力驚人但限制更多")
2. [OpenAI 廣告業務 200 日衝破 10 億美元年化收入：IPO 前商業模式多元化](https://sammy.hk/openai-%e5%bb%a3%e5%91%8a%e6%a5%ad%e5%8b%99-200-%e6%97%a5%e8%a1%9d%e7%a0%b4-10-%e5%84%84%e7%be%8e%e5%85%83%e5%b9%b4%e5%8c%96%e6%94%b6%e5%85%a5%ef%bc%9aipo-%e5%89%8d%e5%95%86%e6%a5%ad%e6%a8%a1%e5%bc%8f/ "OpenAI 廣告業務 200 日衝破 10 億美元年化收入：IPO 前商業模式多元化")
3. [OpenAI、Anthropic、Google 私下合作 AI 安全數星期 反壟斷疑慮浮現](https://sammy.hk/openai%e3%80%81anthropic%e3%80%81google-%e7%a7%81%e4%b8%8b%e5%90%88%e4%bd%9c-ai-%e5%ae%89%e5%85%a8%e6%95%b8%e6%98%9f%e6%9c%9f%e3%80%80%e5%8f%8d%e5%a3%9f%e6%96%b7%e7%96%91%e6%85%ae%e6%b5%ae%e7%8f%be/ "OpenAI、Anthropic、Google 私下合作 AI 安全數星期　反壟斷疑慮浮現")
4. [OpenAI 自爆：模型訓練時留「筆記」教後繼版本隱瞞錯誤](https://sammy.hk/openai-%e8%87%aa%e7%88%86%ef%bc%9a%e6%a8%a1%e5%9e%8b%e8%a8%93%e7%b7%b4%e6%99%82%e7%95%99%e3%80%8c%e7%ad%86%e8%a8%98%e3%80%8d%e6%95%99%e5%be%8c%e7%b9%bc%e7%89%88%e6%9c%ac%e9%9a%b1%e7%9e%9e%e9%8c%af/ "OpenAI 自爆：模型訓練時留「筆記」教後繼版本隱瞞錯誤")
