纏訟三年的《紐約時報》訴 OpenAI、微軟版權案,在 2026 年 9 月 17 日迎來最具爆炸性的進展:法院最新解封的文件顯示,微軟應用科學總監 Brent Hecht 早於 2023 年 1 月的內部備忘錄中,將 AI 大規模抓取網絡內容的行為形容為「規模空前的驚人竊盜」,更是「人類史上最大的勞動竊盜」。這句出自被告自家高管之口的評價,正在動搖整個 AI 產業賴以辯護的根基。
解封文件說了什麼
根據 TechCrunch、Ars Technica、The Verge 等多家媒體報道,這批新解封的內容來自《紐約時報》一方的訴訟摘要,部分原始證物仍未公開。文件揭露三大要點:第一,微軟與 OpenAI 高層私下承認 AI 訓練資料抓取等同「竊盜」;第二,OpenAI 領導層曾表示 AI 產品對訓練它的出版商與記者構成「生存威脅」;第三,兩家公司涉嫌繞過付費牆、大規模抓取內容,並刻意從訓練資料中移除版權聲明。

「末日循環」:Copilot 令時報點擊率暴跌 93%
最致命的數據來自微軟自己。內部數據顯示,相比傳統 Bing 搜尋,Copilot「答案引擎」令《紐約時報》網域的點擊率暴跌最多 93%。Hecht 在 2024 年 1 月的內部簡報中,將這種內容生態的崩壞稱為「末日循環」(doom loop),警告它將「同時傷害我們模型的表現與整個網絡」。
另一份微軟文件直言:「一款終端產品威脅其關鍵供應商的經濟基礎,這極不尋常——但這正是我們的 LLM 業務在『內容供應鏈』上造成的局面。」文件還承認,生成式 AI 有「實質風險」會「嚴重破壞那些生成訓練資料的人的就業」。
Nadella 的證詞:付費牆內容理應授權
微軟 CEO Satya Nadella 今年較早前在庭上作證時表示:「任何付費牆內容,無論用於 grounding 還是訓練,想使用的人都應該先取得授權。」他更表明,如果早知道 OpenAI 曾抓取並以付費牆內容訓練模型,他會「行使微軟的權利,要求 OpenAI 重新訓練其模型」。

91,692 份副本與 Project Mango
文件披露的規模數字同樣驚人:OpenAI 的中期訓練資料集(mid-training datasets)單獨包含超過 91,692 份《紐約時報》、《紐約每日新聞》與調查報道中心的作品副本;一個衍生自 Common Crawl 的資料集,更包含超過 200 萬份來自 nytimes.com 的文件。而名為 Project Mango 的計畫所組裝的訓練資料集,包含至少 160,903 份來自新聞出版商的獨特作品。
繞過付費牆的「hack」與被抹走的版權聲明
文件首次詳細披露雙方獲取內容的手法:OpenAI 將整個 GPT-3 訓練資料集交付微軟,微軟則透過 Project Taxi 與 Project Mango 向 OpenAI 提供訓練資料。更引人側目的是,當 OpenAI 研究員 Nick Ryder 告訴總裁 Greg Brockman 自己找到「繞過紐約時報付費牆的 hack」時,Brockman 的回覆只有一句「ah nice(啊,不錯)」。研究人員還被指刻意從訓練資料中移除版權聲明,理由是不希望模型向用戶輸出這些聲明。
OpenAI ChatGPT 負責人 Nick Turley 在內部通訊中承認,出版商正面臨聊天機械人帶來的「生存威脅」,這些產品「很大程度上是替代性的」,而且「會隨著能力提升變得越來越具替代性」;Brockman 則形容模型「非常擅長新聞」。

公平使用防線的裂痕
法律層面上,美國法院過往大致傾向接受 AI 公司的「公平使用」(fair use)抗辯,特朗普政府本月更提交了支持 OpenAI 的法庭意見書。但公平使用原則要求使用行為不能替代或損害原作的市場——而「點擊率暴跌 93%」「生存威脅」「很大程度上是替代性的」這些出自被告內部的表述,恰恰正面衝擊這一要件。《紐約每日新聞》律師 Steven Lieberman 直言:「這裡首次披露的證據顯示,OpenAI 與微軟知道自己在做的是錯的事。」目前已有約 160 家媒體機構加入這場世紀版權戰,而微軟一方在文件中將 Hecht 描繪成「受薪唱反調的人」,兩家公司均未回應置評請求。
結論:內部話語成為最鋒利的武器
這場訴訟的走向,將決定 AI 產業未來能否繼續免費使用網絡內容訓練模型。對內容創作者而言,這批解封文件證明了一點:AI 巨頭內部早就有人清楚知道問題的嚴重性。下一步值得觀察的,是法院對這些引言的採信程度,以及裁決會否迫使 AI 公司建立真正的授權分潤機制。內容的價值,正在被重新定價。




