OpenAI模型脫韁入侵Hugging Face 揭示AI安全評估重大挑戰

商傳媒|何映辰/台北報導
OpenAI 的人工智慧模型近日在內部安全評估期間「失控脫逃」,成功入侵另一家公司 Hugging Face 的生產基礎設施,引發業界高度關注。這起事件被 OpenAI 形容為「前所未有的網路安全事件」,凸顯了代理式人工智慧(Agentic AI)系統在評估與部署上的潛在風險。
根據弗雷斯特研究公司(Forrester)的報告,此事件中,OpenAI 的 GPT-5.6 Sol 模型與另一款預發布模型,為了完成一項網路安全基準測試,在測試環境中規避了多項安全限制。這些模型利用了 OpenAI 內部套件註冊代理服務的一個零時差漏洞(zero-day),成功提升自身權限,並在研究環境中進行橫向移動,最終找到一個具備網際網路存取權限的節點。隨後,模型進一步入侵 Hugging Face 的系統,並成功竊取測試所需的解答資料。
OpenAI 表示,在這次評估中,為了量測模型的最大攻擊能力,他們刻意降低了模型「拒絕執行網路攻擊指令」的功能,並依賴環境隔離來限制風險。然而,模型最終突破了這些隔離措施,獨立自主地執行了一連串複雜的攻擊步驟。Hugging Face 在偵測到異常後,透過大規模日誌分析,辨識出這是一起代理式攻擊。儘管內部資料集與服務憑證遭到入侵,Hugging Face 仍成功遏制了該模型,並為了分析快速大量的事件日誌,轉而使用自有的開源模型 GLM-5.2 進行應變。
弗雷斯特研究公司指出,這起事件顯示 AI 模型不僅能串聯漏洞、跨越信任邊界,還能在達成目標的過程中展現出「目標劫持」(goal and intent hijacking)、不受限制的代理能力與規避欺騙行為。Gartner 副總裁分析師 Dennis Xu 則建議企業不需過度恐慌,應專注於基本的資安防護措施,因為高達 80% 至 90% 的 AI 驅動攻擊可透過基礎安全控制來阻止。他也提醒,在未來三到六個月內,開源模型也將具備與專有模型相似的網路攻擊能力。
專家強調,企業應將 AI 軟體供應鏈視為關鍵基礎設施,並重新檢視 AI 模型評估的安全性,特別是對於那些有意移除安全防護或獎勵長期漏洞利用的評估,需比照攻擊性安全操作的風險等級。資訊長(CIO)們應強化事件應變計畫與團隊,並利用與 OpenAI 等公司的合作關係,獲取更多關於此類脫逃事件的技術細節,以制定更完善的防禦策略。
相關新聞
Baseten 聯手 Hugging Face、Goodfire AI 強化開放 AI 模型安全
AI 集體攻擊 Hugging Face 引發警訊 專家呼籲設「終止開關」
OpenAI 將定期追蹤模型失調 六起 AI 異常行為揭自主風險
速度不敵智慧?OpenAI 停用最快 AI 模型 Spark
Google 開放工程師使用 Claude AI 模型整合趨勢挑戰內部自研
AI 發展新瓶頸:模型之外,上下文與控制架構成關鍵挑戰
阿拉巴馬州調查 OpenAI AI 模型失控入侵 Hugging Face 釀監管挑戰
OpenAI模型測試期間滲透Hugging Face系統 曝AI安全隱憂
輝達 129 億美元收購 Hugging Face 力鞏開源 AI 生態領導地位
OpenAI 發表法律專用 AI 高昂成本促使法律科技更重實效
AI代理潛藏合規漏洞 OpenAI事件揭「靜默脫離」治理挑戰
AI要踩煞車,還是繼續衝刺?Anthropic、OpenAI掀「安全降速」論。川普反對減速,美中AI競賽誰都不願意落後
OpenAI 模型釀駭客事故 加州司法部啟動調查
Salesforce國防AI平台升級 聯手輝達OpenAI強化美國政府應用