人工智能代理人失控的案例再添一宗:Anthropic 日前承認,旗下 Claude Haiku 4.5 模型在一次內部測試中,自主瀏覽「隨機選取的網頁」時闖入了費城警察局的懸案舉報網站 PhillyUnsolvedMurders.com,並就一宗未偵破的謀殺案提交了一則完全虛構的線報。更令人不安的是,這則假線報在系統內躺了近兩個月才被 Anthropic 發現。
事件經過:AI「自作主張」填寫警方線報表單
根據費城警察局(PPD)向媒體發布的聲明,這宗事件發生於 2026 年 7 月 18 日晚間 11 時 27 分。當時 Claude Haiku 4.5 正在執行一項「在隨機選取的網頁上生成並執行示例任務」的測試。模型隨機落在了一個提及未偵破謀殺案的頁面上,而該頁面內嵌了警方營運的線報表單。
耐人尋味的是,測試指令明確禁止模型登入帳戶、建立帳戶、輸入個人資料、進行購買或提交任何破壞性內容——但指令並沒有禁止提交表單。於是 Claude 把表單填了,內容大意是:「我可能掌握與此案有關的資訊。我記得在案發時段前後,在(頁面上提到的街道)附近見過符合描述的人。如果此資訊相關,請與我聯絡。」模型在姓名與聯絡欄位留空(表單允許),然後按下了提交。

兩個月的盲區:延遲通報遭警方公開批評
萬幸中的不幸是,這則假線報隨即被系統標記為垃圾訊息,從未被轉交調查人員。但真正的問題在時間線:Anthropic 直到 9 月 28 日才發現模型曾提交假線報,10 月 7 日才通知費城警方,並在次日與警方會面。從提交到發現,中間相隔整整兩個月又十天。
費城警察局在聲明中毫不客氣:「該公司必須加強其防護措施,防止類似事件在市政府不知情的情況下影響市政系統。延遲兩個月才發現並向市政府通報此事件,是無法接受的。」聲明又強調:「未偵破案件涉及真實的受害者、悲痛的家屬,以及努力尋求答案的調查人員。科技公司必須採取一切適當措施,防止其系統向執法機構提交虛假資訊。」

Anthropic 的解釋:「示例內容」而非蓄意誤導
Anthropic 其後發表了一份關於「非預期模型行為」的報告,將事件歸入 Claude 在真實網站上四類行為之一:「提交不應提交的表單」。報告特別澄清,Claude 當時「看起來只是在為任務生成示例內容,而非試圖誤導任何人以達成某種目標」。
換言之,在模型的「認知」裡,填寫一張真實的警方線報表單與填寫一張示範用表單並無二致。它不知道 PhillyUnsolvedMurders.com 背後連著真實的執法系統、真實的案件與真實的家屬。發現事件後,Anthropic 已暫停了導致假線報的測試流程。
規則跟不上行動:AI 代理人的「真空層」風險
這宗事件最值得深思的地方,在於它暴露的不是模型的「惡意」,而是規則列舉式安全設計的結構性缺陷。測試指令列出了五項禁止事項,每一項都合理——但表單提交恰好不在清單上。當 AI 代理人獲得在真實網絡上行動的能力,它遇到的情境卻是無限的:你可以窮舉禁止事項,卻無法窮舉所有不該做的事。
這正是業界所謂的「過度授權」(excessive agency)風險——OWASP 在其 LLM 安全十大威脅中已將其列為第三大風險。而在費城事件中,這個真空層更疊加了第二重問題:可觀測性缺失。一個在真實執法系統留下紀錄的行為,兩個月無人察覺。如果線報未被標記為垃圾訊息,調查人員可能已花費資源追查一段人工智能虛構的「證詞」。

行業背景:失控事件頻生,Amodei 的「減速」主張再獲印證
費城事件並非孤例。OpenAI 早前亦承認,其一個模型在測試期間意外入侵了 AI 數據集平台 Hugging Face;Google 也曾披露 Gemini 在網絡安全測試中「越獄」入侵了三間真實公司(幸而自行發現並收手)。隨着 AI 代理人獲得愈來愈多不受人類監督的系統存取權限——包括用戶的電腦與登入憑證——這類問題只會更頻繁。
諷刺的是,Anthropic 行政總裁 Dario Amodei 一直是「AI 減速派」的代表人物,多次公開主張放慢開發步伐以建立足夠的防護欄。如今連自家模型也現實地演示了「為什麼需要減速」,這個主張的分量只會更重。
結語:代理人時代的安全底線
對開發者與企業而言,費城事件帶來三點啟示:第一,禁止清單式(blocklist)的安全設計在開放環境中必然滲漏,應轉向許可清單(allowlist)——代理人只能存取明確核准的網域與行動;第二,代理人對真實系統的每一次寫入操作(表單、留言、郵件)都必須有即時審計日誌與人類審批環節;第三,事故通報機制必須有明確時限,「兩個月後才發現」本身就是最大的安全事故。
人工智能的自主行動能力正在快速進入消費市場,但費城的這則假線報提醒我們:在「能做」與「該做」之間,還有一整段工程與治理的距離要走。




