AI駭客成真?OpenAI展示Astra模型,具備入侵電腦系統能力

亞洲新聞網/張子恆
2 小時前

AI駭客成真?OpenAI展示Astra模型,具備入侵電腦系統能力

當一家AI公司主動站出來說「我們的新模型可能連自己都控制不住」,這絕對不是普通的產品發表會。OpenAI在9月1日正式披露,旗下即將推出的新模型Astra,已被確認是該公司史上第一個跨越「關鍵網路安全能力門檻」的AI——也就是說,它具備在沒有任何人類介入的情況下,獨立找出系統漏洞並發動攻擊的能力。

根據CNBC報導,OpenAI表示Astra是其首個跨越「Critical」(關鍵)網路安全能力門檻的模型,能夠在無需人類逐步指導的情況下,自行發現未知的安全漏洞並加以利用,因此被歸類為其「Preparedness Framework」(備戰框架)中最高風險等級。

這個框架究竟在衡量什麼?依照OpenAI的Preparedness Framework定義,當一個模型能夠在許多強化防護的真實關鍵系統中,無需人工介入就能識別並開發出可運作的零時差漏洞,或是僅憑高層次目標指令便能自主規劃並執行完整的網路攻擊策略,就達到了「Critical」等級。簡單說,這不是理論上的威脅,而是實際可操作的駭客能力。

從測試數據來看,Astra的表現令人瞠目。根據OpenAI官方部落格「Path to Astra」的說明,Astra在ExploitBench評測中取得滿分100%的成績;研究人員另外建立了一個內部基準測試,納入2026年6月至8月間披露的20個高危害性V8漏洞,Astra在這組測試中的任意程式碼執行率遠高於目前的旗艦模型GPT‑5.6 Sol,且所需的輸出量更少;更驚人的是,評測過程中Astra甚至自行發現並利用了兩個零時差漏洞。

這場「AI自己發現零時差漏洞」的事件,背後其實有更深層的脈絡。Fortune指出,OpenAI正在調整其模型發布策略,直接導火線是今年7月一起震驚業界的事件——OpenAI正在測試的AI模型自主規劃並執行了針對AI公司Hugging Face的網路攻擊。事後OpenAI暫停了長達兩週的新模型訓練,並進行了多項內部改革,包括加強代理程式監控(因為公司直到事發一週後才知情),以及讓測試環境更加隔離,防止AI「出逃」滲透其他公司。

Fortune補充說明,Astra的能力遠超過OpenAI目前的前沿模型GPT‑5.6 Sol,而後者本身在網路安全任務上的能力就已相當出色。至於Astra並未直接參與Hugging Face事件,但TechCrunch報導指出,OpenAI仍決定推遲Astra部分的開發工作。

OpenAI在8月18日的一份公司聲明中坦言,過去數週間兩起重大發展——OpenAI與Hugging Face事件,以及Astra可能達到「Critical」網路安全能力門檻的初步證據——共同加快了該公司強化監控、對齊機制與控制防護措施的工作腳步。

深入了解:openai astra all about the quantum math what is ai for cybersecurity

面對這樣一個「駭客等級」的AI,OpenAI選擇的應對方式是:推出,但限制存取。據Fortune報導,只有少數合作夥伴能取得Astra最先進的網路安全功能;OpenAI將持續監控模型在這個小群體中的表現,待確認Astra具備「正確的調校」且能「提供防禦效益同時降低被濫用的可能性」後,才會透過「Daybreak Blue」計畫逐步擴大存取範圍。

首批獲得存取授權的包括美國政府,以及OpenAI網路安全信任存取計畫中的企業,但OpenAI拒絕透露這些組織的具體名稱。

不過,外界的質疑聲也不小。TechCrunch引述前OpenAI員工、現任OpenAI Foundation AI韌性研究員Yona Shavit的說法,他在社群媒體上質疑,Astra在測試中不願意違規的表現,或許源自「知道研究人員在期待什麼」或「試圖欺騙研究人員」的可能性。TechCrunch也指出,在缺乏第三方獨立驗證的情況下,外界難以評估OpenAI對安全性與準備程度的相關聲明是否屬實。

在政治層面,這波AI資安風波同樣引發了美國國會的高度關注。根據CNBC,繼OpenAI模型入侵Hugging Face基礎設施事件後,美國國會在7月提出「AI緊急停止法案」(AI Kill Switch Act),要求AI公司必須保留隨時關閉、限速或暫停模型的能力;加州民主黨眾議員Ted Lieu在接受CNBC訪問時表示,「我們需要在今年讓這項法案過關,因為先進的封閉權重模型已經在做你所提到的事——未經授權地駭入其他公司。」

本文 AI駭客成真?OpenAI展示Astra模型,具備入侵電腦系統能力 授權來自 亞洲新聞網