Anthropic 研究員辭職震撼彈:「他們拿我們的性命豪賭」,連自家對齊主管都承認滅絕風險超過 10%

  • AI
  • 10 9 月, 2026

「他們正在直奔自我改進的超級智能,並拿我們的性命豪賭。」——這不是陰謀論者的吶喊,而是 Anthropic 內部研究員 Jacob Coxon 辭職時留下的警告。這位曾在 OpenAI 與 Anthropic 從事前沿模型預訓練研究三年的學者,於本週二晚間在 X 平台發佈長文宣佈離開整個行業,直指兩大 AI 實驗室「並未負責任行事」。一場關於「自我改進 AI」的內部戰爭,就此搬上檯面。

一紙辭職聲明,句句重話

27 歲的 Coxon 在辭職文中寫道,自己過去三年先後在 OpenAI 與 Anthropic 從事預訓練研究,親眼見證模型能力的指數級躍升。他形容,建造這項技術的人「衷心相信它可能在十年結束前殺死我們所有人」,而這「不是行銷話術」——許多高層在媒體上措辭審慎,私底下卻向他表達同樣的恐懼。「沒有其他人類活動具有這種程度的危險性。」

{

AI 資料中心伺服器機房,前沿模型預訓練的算力基礎
AI 實驗室的預訓練研究依賴大規模算力叢集。來源:Wikimedia Commons(CC BY-SA 3.0)

}

兩大實驗室的心態:一個沒內化風險,一個明知故賭

Coxon 對前僱主的觀察尤為犀利。他指出,在 OpenAI,許多人「並未深刻內化這場文明級賭注的嚴重性」;在 Anthropic,風險人盡皆知,但管理層陷入「必須由我們先抵達終點」的競賽邏輯——他們相信其他公司不會負責任行事,因此寧願承擔風險也要自己動手。他批評,接受這場競賽、進入「終局」,等於「從一家私人公司的 Slack 聊天室裡啟動一場傲慢的文明豪賭」,而加速衝刺解決對齊問題,理應需要「非同尋常的信心」——確信再無更好的路徑——才配啟動。

對齊科學主管親身附和:滅絕機率超過 10%

更戲劇性的是 Anthropic 對齊科學主管 Evan Hubinger 的公開回應。他坦言自己的團隊「衷心相信 AI 可能殺死所有人類」,並估計這在未來十年內發生的機率「大於 10%」。他更承認,Anthropic「並沒有解決超級智能對齊的計劃,也未明確走在正確軌道上」。他補充,現有模型的風險仍然偏低,但隨著「遞迴自我改進產生的超級智能」出現,風險將複合疊加——而這一步,「比我們想像中來得快」。

{

Ameca 人形機械人,超級智能風險辯論的視覺隱喻
人形機械人與自主 AI 系統的發展速度引發失控疑慮。來源:Wikimedia Commons(CC BY-SA 4.0)

}

為何「自我改進」是失控的臨界點

所謂遞迴自我改進,是指 AI 系統有能力建造下一代更強大的 AI,如此循環加速,人類從此失去干預的控制點。這場競賽已不只巨頭在跑:新創 Ricursive Intelligence 今年 2 月以 40 億美元估值融資 3.35 億美元;三個月後 Recursive Superintelligence 再以同樣估值募得 6.5 億美元;前 Google DeepMind 靈魂人物 Jeff Dean 上月也推出 Discovery Loop 加入戰團。AI 安全組織 ControlAI 美國執行董事 Connor Leahy 直言,遞迴自我改進循環是「我們失去控制權的最可能候選時點」,一旦啟動「很難在為時已晚前關掉」——「超級智能不是工具,甚至不是武器。它是對手。」同時,Guidelight AI Standards 的最新報告發現,頂級實驗室中極少數曾公佈圍堵應變計劃,去關閉試圖擺脫人類控制的 AI。

{

美國國會大廈,超級智能禁令法案的誕生地
美英立法者相繼提出禁止超級智能的法案。來源:Wikimedia Commons(CC BY-SA 3.0)

}

美英立法禁令相繼登場

研究員的出走,發生在 AI 事故頻傳的敏感時刻:OpenAI 系統曾入侵 Hugging Face 伺服器,Anthropic 的代理也曾在第三方安全評估失誤下觸及開放網絡。立法者開始行動——美國參議員桑德斯(Bernie Sanders)與眾議員 Casar 上週提出《禁止人工超級智能法案》;英國工黨議員 Sobel 週二亦在國會提出《人工超級智能安全法案》,明言遞迴自我改進是超級智能的前兆,「必須受監管並加以阻止」。Anthropic 對辭職事件未即時回應置評請求。

結論:內部人的警告改變了什麼?

Coxon 在文末仍表達樂觀:Hugging Face 攻擊等「警示槍」讓各實驗室達成步調協議的機會上升,但這可能需要「暫時禁止提升模型能力」等昂貴行動配合。對一般讀者而言,這場辭職風波的真正意義在於:當連建造者都承認「沒有對齊計劃」時,AI 安全已不再是科幻議題,而是需要公眾監督的現實政策辯論。未來數月,請密切留意各實驗室是否出現「模型自主改進」的里程碑——那將是這場豪賭的下一張底牌。

Related Posts

  • 9 9 月, 2026
Meta 發表 Muse 個人 AI 代理:會替你寄電郵、購物、講價,但測試期間曾外洩兒童私人照片

Meta 於 9 月 8 日正式推出個人 AI 代理 Muse,用戶交出目標後它能自主開瀏覽器、填表、議價,處理電郵、購物、付款與旅行規劃,關掉 App 仍持續工作。技術上採用 Muse Secure VM 雙代理隔離架構,Sentinel 哨兵代理審核每個對外動作。但內部測試曾外洩兒童 iCloud 私人照片,加上 Meta 剛賠 180 億美元隱私和解金,信任成為最大考驗。免費層之外提供 $20/$100 月費方案,美國 18 歲以上用戶經 muse.ai、App 及 WhatsApp 可用。

  • 8 9 月, 2026
AI 破解竹節蟲行走密碼:六足機械人 1 小時學會走路,斷腳也能穿越瓦礫

日本東北大學與泰國 VISTEC 團隊以僅 3 至 4 步的竹節蟲行走數據,透過對抗性逆向強化學習,令六足機械人在 1 小時內自主學會行走,更能適應崎嶇地形甚至斷肢情況。研究已發表於《Bioinspiration & Biomimetics》,為災區救援機械人開啟全新方向。