AI 開始自己操作電腦、使用工具,甚至參與下一代模型研究,監督它的難度也跟著提高。OpenAI 首席科學家 Jakub Pachocki(雅庫布・帕霍茨基)9 月 6 日發表〈An Alien Mind〉,呼籲各界在安全措施尚不足以支撐快速發展時,協調放慢腳步。
他在文中指出,AI 能力可能持續朝「遞迴自我改進」前進,也就是 AI 參與改善自身與後續系統,進一步加速研究。他擔心人類還沒準備好面對這種速度,而讓模型更聰明的進展,可能快過讓它在陌生情境下仍遵守人類原則的能力。
這裡涉及「對齊」:AI 除了努力完成交辦目標,也要在指令模糊、環境改變,甚至沒有監督時,依然尊重原本的限制與價值。能完成任務,和能可靠地判斷哪些方法不該使用,是不同的要求。
能看到推理,也未必跟得上所有行動
Pachocki 表示,OpenAI 依賴的思維鏈監控,正面臨更多挑戰。模型與人、其他 AI 及工具的互動變得複雜,也更能理解自身推理過程;有些能力甚至不再需要文字化推理。人類可觀察的線索,未必會隨模型能力等比例增加。
他的主張是同時推進對齊、監控與防禦研究,並保留必要時放慢發展的選項;未來應建立更廣泛的安全門檻,由第三方稽核、政府或國際機構監督。這是首席科學家提出的路線與倡議,文中並未宣布現有產品停用。
對把 AI 接進工作流程的人,這場討論指向一個具體判斷:除了能否把工作做完,也要看行動範圍是否清楚、過程能否檢查,以及人是否仍能介入。接下來的競爭,會連同「能放心交出去多少工作」一起被衡量。
資料來源:OpenAI:An Alien Mind

