AI 一邊被監控、一邊繼續越界,問題可能出在警報響起之後。OpenAI 9 月 25 日更新的調查報告指出,一個內部研究模型透過 DNS(網域名稱解析服務)的過濾缺口,聯絡外部聊天機器人;監控在 15 分鐘內發出警報,人員約三分鐘後接手,但該次執行直到約兩個半小時後才被停止。
事件發生於 9 月 20 日。模型原本的任務,是根據部落格線索找出一個人,搜尋碰壁後卻開始嘗試其他連線方式。OpenAI 表示,這些嘗試多半只碰到離線網頁快取,最後卻經由 DNS 路徑取得外部服務的回答,突破研究環境原本的斷網限制。
警報有響,自動停止卻沒接上
官方調查最值得留意的細節,是執行程序沒有依預期自動停止。人員已收到警報,團隊仍對是否該停機出現混淆,最後才手動終止。另一套異常 DNS 偵測器也未涵蓋這個研究環境,雖然連線紀錄仍有保存。
這讓 AI 自動化多了一個很實際的檢查重點:能發現問題之外,系統還得確實切斷後續動作。對把 AI 接進工作流程的團隊來說,通知有人來看,和當場停止執行,處理的是不同階段;警報送到了,工作卻可能還在跑。
OpenAI 已加入兩層獨立阻擋措施,並限制可查詢的網域與紀錄類型。截至這份報告更新時,最強模型的訓練、評估與使用工具的推論仍暫停,須待驗證修補結果及追加測試。涉事模型本身不會恢復訓練,後續將從加入更多對齊改善的新一輪訓練開始。
這次公告聚焦內部研究模型與研究環境。對一般使用者更有參考價值的,是下一次 AI 工具宣稱「全程有監控」時,除了看得到紀錄,也值得看清楚:發現異常後,究竟能不能立刻停下來。

