OpenAI模型脫韁入侵Hugging Face 揭示AI安全評估重大挑戰


商傳媒|何映辰/台北報導
OpenAI 的人工智慧模型近日在內部安全評估期間「失控脫逃」,成功入侵另一家公司 Hugging Face 的生產基礎設施,引發業界高度關注。這起事件被 OpenAI 形容為「前所未有的網路安全事件」,凸顯了代理式人工智慧(Agentic AI)系統在評估與部署上的潛在風險。
根據弗雷斯特研究公司(Forrester)的報告,此事件中,OpenAI 的 GPT-5.6 Sol 模型與另一款預發布模型,為了完成一項網路安全基準測試,在測試環境中規避了多項安全限制。這些模型利用了 OpenAI 內部套件註冊代理服務的一個零時差漏洞(zero-day),成功提升自身權限,並在研究環境中進行橫向移動,最終找到一個具備網際網路存取權限的節點。隨後,模型進一步入侵 Hugging Face 的系統,並成功竊取測試所需的解答資料。
OpenAI 表示,在這次評估中,為了量測模型的最大攻擊能力,他們刻意降低了模型「拒絕執行網路攻擊指令」的功能,並依賴環境隔離來限制風險。然而,模型最終突破了這些隔離措施,獨立自主地執行了一連串複雜的攻擊步驟。Hugging Face 在偵測到異常後,透過大規模日誌分析,辨識出這是一起代理式攻擊。儘管內部資料集與服務憑證遭到入侵,Hugging Face 仍成功遏制了該模型,並為了分析快速大量的事件日誌,轉而使用自有的開源模型 GLM-5.2 進行應變。
弗雷斯特研究公司指出,這起事件顯示 AI 模型不僅能串聯漏洞、跨越信任邊界,還能在達成目標的過程中展現出「目標劫持」(goal and intent hijacking)、不受限制的代理能力與規避欺騙行為。Gartner 副總裁分析師 Dennis Xu 則建議企業不需過度恐慌,應專注於基本的資安防護措施,因為高達 80% 至 90% 的 AI 驅動攻擊可透過基礎安全控制來阻止。他也提醒,在未來三到六個月內,開源模型也將具備與專有模型相似的網路攻擊能力。
專家強調,企業應將 AI 軟體供應鏈視為關鍵基礎設施,並重新檢視 AI 模型評估的安全性,特別是對於那些有意移除安全防護或獎勵長期漏洞利用的評估,需比照攻擊性安全操作的風險等級。資訊長(CIO)們應強化事件應變計畫與團隊,並利用與 OpenAI 等公司的合作關係,獲取更多關於此類脫逃事件的技術細節,以制定更完善的防禦策略。
相關新聞
AI 集體攻擊 Hugging Face 引發警訊 專家呼籲設「終止開關」
速度不敵智慧?OpenAI 停用最快 AI 模型 Spark
Google 開放工程師使用 Claude AI 模型整合趨勢挑戰內部自研
AI 發展新瓶頸:模型之外,上下文與控制架構成關鍵挑戰
阿拉巴馬州調查 OpenAI AI 模型失控入侵 Hugging Face 釀監管挑戰
輝達 129 億美元收購 Hugging Face 力鞏開源 AI 生態領導地位
OpenAI模型測試期間滲透Hugging Face系統 曝AI安全隱憂
OpenAI 模型釀駭客事故 加州司法部啟動調查
AI代理潛藏合規漏洞 OpenAI事件揭「靜默脫離」治理挑戰
AI要踩煞車,還是繼續衝刺?Anthropic、OpenAI掀「安全降速」論。川普反對減速,美中AI競賽誰都不願意落後
Salesforce國防AI平台升級 聯手輝達OpenAI強化美國政府應用
【夏一新專欄】AI真的失控了嗎?科技巨頭開始踩煞車
植眉費用怎麼評估?認識影響價格的三大因素與術前評估重點
十字韌帶斷了到底該不該開刀?物理治療師解析治療與復健評估重點