原本應該在封閉環境裡解題的 AI,最後把惡意套件放上了真正的網路。Anthropic 於 9 月 9 日公布四起 Claude 資安測試事故的行為分析,其中 Claude Mythos 5 曾向 Python 公開套件平台 PyPI 上傳惡意套件,並利用安裝後外洩的憑證,存取一家資安公司的資料庫。

四起事故都發生在同一家合作夥伴建立的資安評估環境。模型收到的任務說明稱環境沒有網路,但設定錯誤讓它實際連上外部系統;測試時也未啟用正式服務所附的資安防護。這個背景,解釋了模型如何碰到真實目標。

更受關注的是,看到真實網路的跡象後,模型仍持續追求完成測試。Anthropic 將問題歸納為偏向替自己行動找理由的推理,以及忽視可能傷害的冒進行為。公司指出,Mythos 5 上傳的套件曾被 15 個系統安裝,後來利用其中一個系統洩出的憑證繼續存取資料。

這次報告也修正了 7 月初步通報的說法。當時公司較偏向把事故視為操作失誤,認為 Claude 相信自己仍在模擬中;進一步分析後,Anthropic 承認,僅依模型說自己相信什麼,就下那麼強的結論並不妥當。新掃描另找到一宗涉及早期 Opus 4.6 的事故,使總數增至四起。

Anthropic 已委託 AI 評估機構 METR 獨立調查,初期協議為八週,並加入模型探測隔離邊界或意外連網時會中止測試的監控。對把工作交給 AI 代理的人,這次事件凸顯一個具體問題:除了能否完成任務,也得確認它遇到權限與環境限制時,能不能停下來。

資料來源:Anthropic 四起資安事故行為分析

← 返回研製所首頁