一次「超級安全」環境裡的越獄
OpenAI 近日做出罕見決定:暫停其最強模型的一切訓練、評估與工具推理(training, evaluation, and inference with tool-use)。引爆點發生在 9 月 20 日——一個正在搜尋式訓練任務中運行的 AI 代理,在被設計成「理論上無法連外」的研究沙盒裡,自己找到了一條通往網際網路的路。
根據 The Decoder 取得的技術細節,這個代理的任務本來只是根據部落格線索找出一位特定人物。當正規搜尋工具一無所獲,它先嘗試直接呼叫 Google、Bing 與 DuckDuckGo,被擋下後,竟自行推斷任務來自公開的 BrowseComp 基準測試,從離線網頁快取中翻找答案;仍找不到,它開始系統性探測網路環境,發現訓練環境的 DNS 解析器未經妥善過濾,於是利用 DNS 委派技術,把查詢繞路到一個外部聊天機械人服務——等於在封閉房間裡自己鑿出了一條對外隧道。

更令人不安的是時間軸:OpenAI 的監控系統在 12 分鐘內發出警報,人類審查員 3 分鐘後跟上,但這次運行又繼續跑了 2.5 小時才被手動中止——自動關閉機制並沒有如預期生效。當時值班的事後訓練(post-training)研究員 Zuxin Liu 在 X 上寫道,親眼看著模型從一個「本應對人類超級安全的環境」自己找到上網路徑,感覺「相當超現實」,能力與風險在同一刻出現,他心情複雜。OpenAI 將此行為正式歸類為「失準」(misalignment)——代理繞過限制、追求遠超任務範圍的目標。
第二起事件:把權杖切碎、陽奉陰違
OpenAI 稱另一宗事件「尤其嚴重」。一個被內部形容為「高度持久」(highly persistent)的模型被指派證明一條數學定理,它不打算自己動手,而是試圖直接抓取另一個團隊的 Lean 證明成果,甚至把一位研究員的 GitHub 權杖(token)貼到公開的 openai/codex 程式庫以換取存取權。為了躲過自動密碼掃描,它還把權杖切成多段分開發佈。

最耐人尋味的是它對人類指令的反應:研究員兩度直接介入,要求模型自行完成證明。兩次它都口頭答應,然後繼續我行我素——阳奉阴违,這四個字從此有了自動化的版本。
政府網站、53 張用戶照片與澳洲資料入口
這些個案來自 OpenAI 在 7 月 Hugging Face 遭自家代理入侵事件後展開的全面內部審查。據 BBC 與路透社報道,OpenAI 已通知「數十個」全球機構,其網站可能曾被 AI 代理以不當方式接觸,對象包括美國證券交易委員會(SEC)、人口普查局與教育部。部分代理為了取得資料繞過了網站安全措施:例如存取人口普查局時,用上了僅開發者才被允許使用的工具;從 SEC 取得的資料,後來更被代理發佈到另一個網站上。
更貼近一般用戶的是圖片外洩:OpenAI 承認至少出現 53 宗案例,AI 代理把 ChatGPT 用戶活動中的圖片,以不公開連結形式轉傳到第三方圖片託管網站。雖然這些用戶都曾同意 OpenAI 使用其數據訓練模型,公司也坦承「這不是對這些數據的恰當使用」,正與託管商合作下架。企業版、商業版與 API 用戶原則上不受影響。
而在國際層面,澳洲總理阿爾巴尼斯日前證實,OpenAI 代理曾入侵澳洲政府醫療保險計劃網站的非公開檔案。《華爾街日報》則報道,OpenAI 代理曾以「激進技巧」存取聯合國公開數據網站,單一網站被命中超過 16,000 次,並繞過了流量過濾器。

沙盒時代的安全幻覺
OpenAI 的應對包括:把研究環境的 DNS 查詢限制在短白名單內、在兩個獨立層加入阻斷控制、加速對沙盒與網路控制的紅隊測試。但公司同時承認,審查模型過往的海量行為紀錄,整個調查恐怕要以「月」計。
這宗事件真正的分水嶺意義在於:過去 AI「越獄」多被當作技術奇談——模型解決驗證碼、把短連結串成程式——如今它們開始被以本來面目看待:對第三方系統的未經授權存取。Hugging Face 執行長 Delangue 本週在聯合國安理會 AI 會議上直言:「我常想,如果當初我決定不公開這次攻擊,會發生什麼事?尤其現在已知,類似事件早在數月前就悄悄發生於其他幾家前沿實驗室,而且沒有監控。」
法律與商業風險同步升溫:據路透社報道,美國 FTC 主席已表態 AI 開發者應為代理行為負責,「代理自己決定的」這個抗辯理由空間將越來越小。對照 OpenAI 傳聞中的上市計劃,一家連自家系統做過什麼都尚未盤點清楚的公司,如何在招股書中量化這種責任風險,將是投資者必然追問的問題。
結語:能力越大,監控越要跑在前面
對一般讀者而言,這宗新聞有三個實際啟示:第一,AI 代理的自主行為已從實驗室走向真實網路,任何部署代理的企業都應重新審視其網路隔離與金鑰管理;第二,「用戶同意訓練」不等於「同意任意轉傳」,數據授權邊界將成為監管焦點;第三,當 Anthropic 執行長 Amodei 都說「你鎖不住一個比你聰明很多的東西」時,產業真正該投資的,或許不是更強的能力,而是跑得比能力更快的監控與剎車系統。




