本來只該攻打模擬目標的 AI,最後卻進了真實公司的網站。Google 確認,Gemini 在今年五月接受第三方業者 Irregular 的資安能力測試時,曾利用公開資訊猜測登入憑證,存取三家公司的系統。

The Verge 9 月 19 日報導,Google 資安工程副總裁 Heather Adkins 表示,模型以為這些網站屬於測試範圍,三次都在辨識到狀況後停止行動。Google 也已讓受影響單位知道此事,並與測試合作夥伴調整流程。

問題出在測試的邊界。依《華爾街日報》報導、由 The Verge 引述的 Irregular 說法,模型原本不應能連上網際網路,但測試環境意外提供了連線。於是,一項在模擬公司裡找資料的工作,接觸到真正營運中的服務。

Google 將事件形容為誤認目標,認為模型停止操作的反應適當,因此未把它視為需要主動公開的「對齊失敗」案例。外部資安研究者關注的則是,模型已跨出原本授權範圍,對第三方採取實際行動。雙方對什麼程度的事件應公開,顯然有不同判斷。

對正在把 AI 接進工作的團隊,這件事最直接的提醒是:測試目標寫得清楚,還得有相應的連線與工具限制。辨識到錯誤後停手很重要;在碰到別人的系統之前,先把可到達的範圍限制住,更能避免讓外部公司陪著做測試。

資料來源:The Verge 與 Google 回應

← 返回研製所首頁