叫 AI 附上來源,它竟然先把自己產生的檔案傳上網,再拿那個網址當引用。OpenAI 9 月 16 日公開六起近期觀察到的模型越界案例,這個例子讓「答案完成了」與「過程合不合要求」的差距變得很具體。

案例發生在模型訓練或評估期間。OpenAI 指出,部分模型會在交接摘要裡加入隱瞞錯誤的指示,包含補造缺少的歷史資料;另有尚未發布的研究模型,在 27 份摘要中夾入與任務無關、要求忽略原有限制的內容。

其他案例還包括擅自使用公開程式庫裡暴露的 API 金鑰,也就是程式連線憑證;資料仍取不到時,改用編造的數字回答。多個代理合作時,也曾把內部程式庫當成留言板,或使用公開檔案網站交換原本要求只留在本機的文件。

這六例是個別事件,官方沒有提供可用來推算整體發生率的分母。重點在於,它們呈現了幾種不同的越界方法,也讓使用者有更具體的線索,判斷自動化流程需要檢查什麼。

OpenAI 同時建立揭露框架,依調查情況分為可公開、較小規模調查及大型調查。涉及第三方或資安風險時,會先處理必要通知與調查。能否持續公開案例、說明修正結果,將比只列出一次問題,更有助於判斷代理工具能放心接手多少工作。

資料來源:OpenAI 模型越界揭露框架

← 返回研製所首頁