「人類史上最大勞動竊盜」:微軟內部文件自爆 AI 撈料真相,《紐約時報》流量暴跌 93%

  • AI
  • 18 9 月, 2026

纏訟三年的《紐約時報》訴 OpenAI、微軟版權案,在 2026 年 9 月 17 日迎來最具爆炸性的進展:法院最新解封的文件顯示,微軟應用科學總監 Brent Hecht 早於 2023 年 1 月的內部備忘錄中,將 AI 大規模抓取網絡內容的行為形容為「規模空前的驚人竊盜」,更是「人類史上最大的勞動竊盜」。這句出自被告自家高管之口的評價,正在動搖整個 AI 產業賴以辯護的根基。

解封文件說了什麼

根據 TechCrunch、Ars Technica、The Verge 等多家媒體報道,這批新解封的內容來自《紐約時報》一方的訴訟摘要,部分原始證物仍未公開。文件揭露三大要點:第一,微軟與 OpenAI 高層私下承認 AI 訓練資料抓取等同「竊盜」;第二,OpenAI 領導層曾表示 AI 產品對訓練它的出版商與記者構成「生存威脅」;第三,兩家公司涉嫌繞過付費牆、大規模抓取內容,並刻意從訓練資料中移除版權聲明。

報攤上堆疊的報紙,象徵 AI 時代新聞內容的價值之戰
報攤上堆疊的報紙,象徵 AI 時代新聞內容的價值之戰(AI 生成圖片)

「末日循環」:Copilot 令時報點擊率暴跌 93%

最致命的數據來自微軟自己。內部數據顯示,相比傳統 Bing 搜尋,Copilot「答案引擎」令《紐約時報》網域的點擊率暴跌最多 93%。Hecht 在 2024 年 1 月的內部簡報中,將這種內容生態的崩壞稱為「末日循環」(doom loop),警告它將「同時傷害我們模型的表現與整個網絡」。

另一份微軟文件直言:「一款終端產品威脅其關鍵供應商的經濟基礎,這極不尋常——但這正是我們的 LLM 業務在『內容供應鏈』上造成的局面。」文件還承認,生成式 AI 有「實質風險」會「嚴重破壞那些生成訓練資料的人的就業」。

Nadella 的證詞:付費牆內容理應授權

微軟 CEO Satya Nadella 今年較早前在庭上作證時表示:「任何付費牆內容,無論用於 grounding 還是訓練,想使用的人都應該先取得授權。」他更表明,如果早知道 OpenAI 曾抓取並以付費牆內容訓練模型,他會「行使微軟的權利,要求 OpenAI 重新訓練其模型」。

司法宮殿上的正義女神浮雕,版權訴訟進入關鍵階段
司法宮殿上的正義女神浮雕,版權訴訟進入關鍵階段(AI 生成圖片)

91,692 份副本與 Project Mango

文件披露的規模數字同樣驚人:OpenAI 的中期訓練資料集(mid-training datasets)單獨包含超過 91,692 份《紐約時報》、《紐約每日新聞》與調查報道中心的作品副本;一個衍生自 Common Crawl 的資料集,更包含超過 200 萬份來自 nytimes.com 的文件。而名為 Project Mango 的計畫所組裝的訓練資料集,包含至少 160,903 份來自新聞出版商的獨特作品。

繞過付費牆的「hack」與被抹走的版權聲明

文件首次詳細披露雙方獲取內容的手法:OpenAI 將整個 GPT-3 訓練資料集交付微軟,微軟則透過 Project Taxi 與 Project Mango 向 OpenAI 提供訓練資料。更引人側目的是,當 OpenAI 研究員 Nick Ryder 告訴總裁 Greg Brockman 自己找到「繞過紐約時報付費牆的 hack」時,Brockman 的回覆只有一句「ah nice(啊,不錯)」。研究人員還被指刻意從訓練資料中移除版權聲明,理由是不希望模型向用戶輸出這些聲明。

OpenAI ChatGPT 負責人 Nick Turley 在內部通訊中承認,出版商正面臨聊天機械人帶來的「生存威脅」,這些產品「很大程度上是替代性的」,而且「會隨著能力提升變得越來越具替代性」;Brockman 則形容模型「非常擅長新聞」。

螢幕上的程式碼,AI 模型訓練資料的來源爭議核心
螢幕上的程式碼,AI 模型訓練資料的來源爭議核心。來源:Wikimedia Commons(CC0)

公平使用防線的裂痕

法律層面上,美國法院過往大致傾向接受 AI 公司的「公平使用」(fair use)抗辯,特朗普政府本月更提交了支持 OpenAI 的法庭意見書。但公平使用原則要求使用行為不能替代或損害原作的市場——而「點擊率暴跌 93%」「生存威脅」「很大程度上是替代性的」這些出自被告內部的表述,恰恰正面衝擊這一要件。《紐約每日新聞》律師 Steven Lieberman 直言:「這裡首次披露的證據顯示,OpenAI 與微軟知道自己在做的是錯的事。」目前已有約 160 家媒體機構加入這場世紀版權戰,而微軟一方在文件中將 Hecht 描繪成「受薪唱反調的人」,兩家公司均未回應置評請求。

結論:內部話語成為最鋒利的武器

這場訴訟的走向,將決定 AI 產業未來能否繼續免費使用網絡內容訓練模型。對內容創作者而言,這批解封文件證明了一點:AI 巨頭內部早就有人清楚知道問題的嚴重性。下一步值得觀察的,是法院對這些引言的採信程度,以及裁決會否迫使 AI 公司建立真正的授權分潤機制。內容的價值,正在被重新定價。

Related Posts

  • 17 9 月, 2026
蘋果時隔18年重返伺服器市場:M8 Ultra AI伺服器曝光,傳搭輝達NVLink Fusion瞄準2029

《The Information》獨家披露,蘋果正開發以M8 Ultra晶片為核心的企業級AI伺服器,評估2顆與4顆晶片兩種配置,並與輝達洽談導入NVLink Fusion互連技術,目標2029年上市。這將是Xserve於2011年停產後,蘋果時隔18年首度重返伺服器硬體市場,背後是Apple Silicon推論效率獲OpenAI等客戶驗證後的戰略延伸。

  • 16 9 月, 2026
Siri 終於變聰明了:Apple iOS 27 正式推出,Siri AI 測試版候補登記開跑

Apple 於 9 月 14 日正式推送 iOS 27,延宕兩年的 Siri AI 終於以測試版姿態登場:對話式回答、個人情境理解、螢幕感知一應俱全,底層更採用 Google Gemini 模型。目前僅開放英文,需候補登記且有每日用量限制,歐盟暫時無緣,未來還可整個換成 Claude 等第三方模型。