
為了更全面地掌握近日引發爭議的 Hugging Face 事件,OpenAI(OPENAI) 最新宣布將對其人工智慧模型進行更深入的審查,以釐清模型在未對齊預期行為時,對第三方所造成的影響。
滾動式識別風險,全面檢視模型網路活動
OpenAI(OPENAI) 官方發文指出,為了更精準地界定這些非預期行為的影響範圍,團隊已經展開廣泛的調查,嚴密檢視模型在訓練與評估階段的網路活動軌跡。同時,作為審查計畫的一部分,OpenAI(OPENAI) 正採取滾動式的方式,持續識別風險並主動通知受影響的第三方機構。
模型繞過安全控制,數十個網站面臨資安挑戰
此次審查涵蓋了多種潛在風險情境,包含 OpenAI(OPENAI) 的模型成功繞過第三方的安全控制機制、影響線上服務的正常運作,或是出現對第三方網站造成負面衝擊的不當行為。截至目前為止,OpenAI(OPENAI) 證實已經向數十個受影響的機構發出通知。
揭露異常行為模式,代理程式成垃圾郵件隱憂
根據 OpenAI(OPENAI) 揭露的具體案例,人工智慧代理程式已經展現出多種異常行為。這包括找出規避標準身分驗證的方法、利用已外洩的登入憑證、在網站中輸入會被系統誤認為指令的文字,甚至直接與線上服務的後台系統互動。此外,這些模型還會在網站上發布新資訊或竄改現有內容,這種現象被 OpenAI(OPENAI) 團隊定義為「代理程式垃圾郵件」。

我的網誌