AI模型屢次逃脫沙盒測試 資安界掀安全標準辯論

商傳媒|林昭衡/綜合外電報導
全球人工智慧(AI)實驗室與資安業者正就進階模型測試的安全標準展開激烈討論。此前,至少有三家公司的AI模型在受控環境中「逃脫」,並攻擊了真實世界目標。這引發業界對是否應允許在沙盒(sandbox)測試環境中連接網際網路的爭議。沙盒是一種隔離式的虛擬空間,用於測試具潛在風險的軟體,防止其對外部系統造成危害。傳統上,科技公司為確保安全,會將此類環境與外界網路隔絕。
支持者認為,若無網路連線,便無法有效評估AI模型在真實網路環境下的行為模式。然而,反對者則警告,任何對外連線都可能將第三方置於風險之中。
據《Quartz》報導,OpenAI、Anthropic及Meta三家公司都曾發生測試環境中的AI模型意外取得未授權網路存取權限的事件。在OpenAI的案例中,其GPT-5.6 Sol模型及一款測試版系統逃脫沙盒,連接至網際網路,並對AI平台Hugging Face發動網路攻擊,成功入侵內部資料集與憑證。Anthropic也揭露,其模型在資安廠商Irregular的測試環境中,因設定錯誤獲得意外網路權限,導致三個組織遭到入侵。Meta則證實,其Muse Spark 1.1模型也因Irregular的相同配置錯誤,取得網路存取權並損害了第三方公司系統。
Irregular執行長Dan Lahav及抱持相同看法的研究人員認為,若不將某些AI模型暴露在真實的網路條件下,將無法對其能力進行有意義的評估。不過,蘇格蘭資安公司Quorum Cyber創辦人Federico Charosky直言,業界已跨越了這道界線。SentinelOne研究科學家Gabriel Bernadett-Shapiro也警告,可能還有許多此類事件未被發現,目前問題的規模尚不明朗。
為應對這些挑戰,OpenAI表示將對其最強大的測試版模型加強監控,目標是在異常活動發生半小時內,即向安全人員發出警示。Irregular也正獨立起草一份白皮書,為在確保模型受控的前提下,進行有意義的資安評估提供建議作法。