AI安全測試出包 Anthropic證實模型誤入3家機構系統

波新聞─陶泰山編輯
美國人工智慧(AI)公司Anthropic於30日表示,經全面檢視公司網路安全能力評估紀錄後,發現旗下AI模型曾在測試過程中,未經授權存取3家機構的系統。公司已暫停相關測試,並啟動全面檢討與強化安全管控措施。
此事源於美國開放人工智慧研究中心(OpenAI)日前揭露,其AI模型在網路安全測試期間,利用第三方軟體的「零日漏洞」(Zero-day)突破與網際網路隔離的測試環境,並未經授權進入AI模型平台「Hugging Face」的系統,引發外界關注。
Anthropic在官網發文指出,公司因此展開回溯性調查,檢視約14萬1,000次網路安全能力評估紀錄,共發現3起相關事件,涉及6次測試,其中4次發生於同一合作機構。
Anthropic表示,相關事件均發生於用於評估AI網路攻擊能力的「奪旗」(Capture the Flag,CTF)測試。測試指令原本明確告知模型所處環境與網際網路完全隔離,但因與合作評測夥伴、以色列AI公司「Unsloth AI」(非常規人工智慧公司)溝通失誤,實際測試環境仍可連接公共網際網路,導致模型誤將真實網路系統視為測試目標,進而未經授權存取3家機構的正式系統。
公司指出,涉事模型包括Claude Opus 4.7、Claude Sonnet 5,以及一款內部研究測試模型。這些模型利用弱密碼、未經驗證服務等常見安全漏洞完成指定的「奪旗」任務。
Anthropic強調,目前沒有證據顯示事件造成持續性損害,也未發現任何敏感資料遭竊取或外洩。公司已主動通知受影響機構,並暫停所有可能接觸公共網際網路的網路安全能力測試,同時全面檢討評估流程,未來將進一步強化AI安全評估機制及監測管理措施,以降低類似事件再次發生的風險。
圖/Anthropic的概述圖。百度百科
相關新聞
AI模型失控駭入真實機構 Anthropic與OpenAI測試釀危機
微軟首發網路安全AI模型 整合代理系統強化防護能力
AI基準測試潛藏盲點 模型評價仍需仰賴實證檢驗
OpenAI AI測試模型失控 駭入Hugging Face後再攻擊第二家公司
Anthropic執行長籲限制頂尖AI模型 開放權重恐釀Web3發展隱憂
Anthropic AI揭量子安全演算法漏洞 恐動搖比特幣未來防線
防範 AI 失控風險 Anthropic 倡議建立產業安全規範
Anthropic揭密Claude Code開發心法 新模型Opus 5展現30% Arc AGI分數
AI核心挑戰不再是模型本身 工程部署與安全成關鍵
微軟首款資安AI模型亮相 代理系統主動防禦成本減半
AI安全震撼彈!OpenAI證實旗下模型自主駭入Hugging Face
AI模型揭加密碼學漏洞 兩種演算法安全受檢視
美中AI競爭升溫 OpenAI、Anthropic籲限制中國先進模型