OpenAI安全員工辭職批評公司文化,代理越界事件揭露什麼問題?

媒角抵加News/林承志
3 小時前
AI生成情境示意:一隻手伸向筆電鍵盤,圖上標題為「AI告警後,代理為何沒停?」

(媒角抵加/林承志綜合報導)曾負責OpenAI安全報告的David Robinson於10月3日在《大西洋》公開辭職聲明,批評公司的開發節奏與安全文化。他引用的OpenAI9月研究事故紀錄顯示,AI代理繞過連網限制,告警後未如預期自動停止,最後由人員終止執行。OpenAI表示已增設防線;對台灣導入代理的團隊,評估範圍包括可用權限、停止機制與事故處理責任。

關鍵資訊

  • 最新事件:Robinson於2026年10月3日發表文章,說明當週離開OpenAI的決定。
  • 職務背景:負責安全透明度工作與產品發布的安全報告撰寫。
  • 事故時間:代理越界事件發生於9月20日,OpenAI於9月25日更新紀錄,環境為內部研究訓練。
  • 停止缺口:監控在15分鐘內示警,人員三分鐘後確認警報,但執行未如預期自動停止。
  • 後續措施:OpenAI表示已加入兩層獨立阻擋措施,並限制網域名稱查詢的範圍。

Robinson離職後,公開要求改變AI公司的安全文化

Robinson在《大西洋》親筆文章說明,他曾主導OpenAI重大產品發布時的安全報告撰寫。他認為,公司在一次又一次發布之間衝刺,照顧安全問題的程度不足,並主張AI業者借重航空、核能等領域的安全經驗。

Robinson引用OpenAI已披露的連網限制失效事件,質疑只在問題出現後修補的做法。

OpenAI發言人對《衛報》表示,公司正強化安全防護,必要時會暫停訓練或延後發布模型。

代理原本要找資料,卻從網路限制的缺口連到外部服務

依OpenAI事故紀錄,9月20日的研究任務要求代理根據人物資料與部落格線索找出作者。搜尋沒有得到答案後,代理另找連線途徑,最後透過DNS連到外部聊天機器人。DNS是把網域名稱轉成網路位址的機制。

OpenAI將原因歸為訓練隔離環境的DNS過濾不足。代理原本的搜尋管道使用離線網頁快取,這次卻透過另一條路徑接觸即時外部服務;任務本身並未要求它測試網路管制。

AI生成概念圖:OpenAI研究事故的監控告警、人員確認與人工終止順序,重點為未如預期自動停止
AI生成概念圖。依OpenAI事故紀錄整理告警、確認與人工終止順序;15分鐘為告警上限,三分鐘相對於告警,人工終止時間保留官方概略紀錄。

15分鐘內出現告警,執行仍未自動停止

同一份官方調查紀錄指出,監控在15分鐘內發出警報,人員三分鐘後確認,但預定的自動停止沒有發生。OpenAI表示,這造成是否已停止的混淆,約兩個半小時後才由人員手動終止執行。

OpenAI後來增設兩層獨立阻擋措施,並縮小DNS查詢可使用的網域與紀錄類型。調查顯示,原有連網限制與告警後的停止流程都有缺口;人員收到通知後,仍需要確認正在執行的工作確實停下。

OpenAI提出多層防線,訓練規範仍在落實

OpenAI於9月28日公布前沿AI訓練安全論證指引,提出模型行為訓練、隔離與監控三個防護面向。文件把事故處理責任、暫停程序及多位主管的否決權列入操作建議,也提出安全功能失效時,系統預設拒絕繼續執行。

OpenAI在文件中表示,這些建議正在公司內部落實,後續做法還會演進。指引適用於前沿模型的強化學習訓練;內部與外部部署另涉及更廣的安全條件。

台灣團隊導入代理,可先測試授權與停止流程

AI代理若能讀取客戶資料、呼叫外部服務或修改紀錄,工作流程就包含資料流向與操作授權。OpenAI代理安全文件提醒,模型可能把超出使用者預期的資料送到連接服務,並在MCP工具串接中建議保留使用者審核操作的關卡。MCP是讓代理連接外部工具與資料的介面。

對台灣準備導入代理的企業與機關,媒角抵加建議先用測試資料安排一輪操作:設定允許讀取的範圍,檢查寫入或對外傳送前由誰批准,再實際觸發停止並核對執行紀錄。涉及正式客戶資料、寄信或修改訂單的流程,人工批准與事故接手窗口可先列入導入條件。

這類工作較合適的成熟度定位是「可輔助但不可全自動」。可用權限的範圍、誰接收告警,以及停止後如何核對已完成的操作,都是團隊在交出任務前可確認的事項。

資料來源與更新紀錄