Altman稱AI還沒迎來iPhone時刻

媒角抵加News/林承志
20 小時前

媒角抵加/林承志綜合報導)

OpenAI 執行長 Sam Altman 在 8 月 23 日接受 David Senra 專訪時說,模型能力已逐漸到位,但 AI 尚未等到如 iPhone 般重寫人機互動的產品時刻。使用現場的關鍵,是代理人能處理愈長的電腦工作後,使用者仍能看得懂它做了什麼、在出錯前叫停,並在付款、寄信與刪除資料等動作前保留自己按下確認的權利。

重點資訊 已知內容
事件 Altman 在 David Senra 訪談中談及 AI 尚未出現「iPhone 時刻」
時間/地點 2026 年 8 月 23 日;線上訪談
工具/產品 Altman 對 AI「iPhone 時刻」的產品判斷;OSWorld 電腦操作基準
工作情境 讓 AI 代為操作電腦、處理跨應用的多步驟任務
人的角色 設定範圍、提供必要資料、審核不可逆動作與最終輸出
可公開結果 Stanford AI Index 2026 記錄 OSWorld 基準的最佳代理人成功率為 66.3%
參考資料 Altman 訪談內容;Stanford AI Index 2026 的獨立基準報告
台灣可用性 台灣列在 ChatGPT 支援地區;各代理功能仍依方案、裝置與企業權限設定而異
導入門檻 權限切分、資料處理規範、失敗可否復原,以及人工核准流程
成熟度 可先用於低風險輔助;高影響動作仍須逐案驗證

Altman把當下比作iPhone出現前

David Senra 的訪談在 8 月 23 日上線。Altman 談到,當前 AI 已具備許多重要技術能力,但還沒有形成一種讓大多數人自然改變操作習慣的產品介面;他以 iPhone 作為那個轉折的比喻。

iPhone 之所以成為常被援引的產品節點,關鍵在於使用者不必先理解底層技術,仍能透過觸控、應用程式與網路服務完成原本分散的工作。套到 AI,問題便從「模型會不會回答」移到「交辦一件事後,使用者能否理解進度、限制權限、隨時中止,並確認結果真的符合目的」。

當 AI 開始替人點選、輸入、查找與移動資料,產品品質取決於兩件事:它能否穩定完成工作,以及人能否保有控制權。資料範圍、操作紀錄、暫停按鈕與送出前確認,都是使用者每天會碰到的介面問題。

369項電腦任務,代理人仍會失手

把這個判斷放回測試數據來看,Stanford AI Index 2026 引述 OSWorld 基準,記錄 AI 代理人在真實電腦環境處理任務的進步。OSWorld 設計了 369 項任務,涵蓋瀏覽器、桌面軟體、檔案與跨應用操作;代理人必須自行完成一連串畫面操作,而非只回答一題文字題。

報告列出的最佳成績為 66.3%。在這套固定測試中,約三分之一任務沒有成功完成。OSWorld 測的是一組明確定義的 369 項任務;公司內部流程還會遇到資料格式、系統權限、例外案件與人工覆核,實際表現須由自己的工作驗證。

因此,Altman 所說的產品斷點不只關於更高的模型分數。若代理人在跨網站、跨檔案的流程裡偶爾選錯按鈕、誤讀欄位或在例外情況停住,使用者最後花在復核與救援的時間,可能抵消自動化節省下來的時間。

代理人能不能幫忙,看三個交接點

第一個交接點是資料。代理人需要哪些資料才能完成任務?名單、共用文件、收件匣與客戶系統各有不同敏感度,提供前先劃出資料夾、欄位與帳號範圍,能減少它碰到無關資訊的機會。

第二個交接點是操作。它要開哪些網站、修改哪些欄位、能否使用正式帳號,應在任務開始前寫清楚。第三個交接點是結果:完成後由誰看報表、誰核對附件、誰能把錯誤撤回。這三個位置清楚,才有條件衡量代理人究竟省下多少時間。

一段成功示範也要回到同樣的問題:它跑的是哪套任務、能否重做驗證、出了錯由誰負責。這些答案越具體,工具越容易進入日常工作。

先交給AI的,是可以復原的工作

對一般工作者而言,較穩健的起點是把一項工作拆成「輸入、執行、確認」三段。輸入階段只提供完成任務必要的資料;執行階段限定 AI 可以開啟的系統與可操作的欄位;確認階段則把會造成金錢、法律、對外承諾或資料損失的動作交回人手。

例如,AI 可以先彙整公開資料、依既定欄位比對試算表、整理會議中的待辦項目,或在測試帳號中完成重複輸入。若任務包含寄出信件、提交表單、改寫正式檔案、刪除內容或下單付款,應在送出前停在明確的人工核准點。這些安排未必最炫目,卻能讓團隊檢查它省下的是哪一段工時、錯誤發生時能否復原。

還有一個容易被忽略的設定:成功條件要在交辦前寫清楚。與其只說「幫我完成這件事」,不如交代資料範圍、禁止碰觸的資料夾、可接受的輸出格式、遇到不確定資訊時的停損規則,以及最後由誰覆核。這正是把模型能力轉成可管理流程的基本功。

鎖定的資料夾、受限的電腦操作與人工確認鍵,串成三個AI代理交接點
AI 生成流程概念圖,以鎖定資料、受限操作與人工確認呈現 AI 代理的三個交接點;非任何產品的官方介面。

台灣能用ChatGPT,代理功能仍要逐項看

OpenAI 的官方支援地區清單列有台灣,ChatGPT 服務在台灣的支援範圍內。代理式功能、企業權限、裝置整合與可操作的外部系統,則依方案與設定而有差異;導入前應以當下的產品頁面、管理介面與公司資安規範逐項確認。

台灣團隊若要判斷一個代理工具能否導入,實際問題通常更細:它能否讀懂公司慣用的繁體中文欄位?能否只接觸授權資料?操作紀錄能否留存?遇到銀行、政府或客戶系統的登入、驗證與權限限制時,流程是否會安全地停下?這些問題比單一跑分更接近日常使用成本。

較務實的測法,是先挑選五個不含機密、可回復的真實任務,與現行人工流程並行操作。每次記錄完成時間、人工修正時間、錯誤類型與是否能撤回;連續測試後,再決定是否擴大權限。

付款、寄信與刪檔,保留人工確認

代理人越接近替人完成工作,風險也會從「答案寫得不準」擴大為「系統真的做了不該做的事」。常見的高影響節點包括:把錯誤資料寄給外部對象、在錯誤帳號提交表單、誤刪共用檔案、把敏感資料貼進不該使用的服務,以及在付款或採購前套用錯誤條件。

人員不必把每一步都手動重做,但必須保留幾個安全閘門:使用最小必要權限、把測試和正式帳號分開、限制可讀取的資料範圍、記錄代理人的操作,以及把不可逆動作改成「先產生草稿,再由人確認送出」。當出現不確定資料、異常金額或未授權網站時,流程應停止,而不是猜測後繼續執行。

這也是為何一次漂亮的示範,還不足以判定代理人可承擔整份工作。真正需要檢查的是失敗發生時的邊界:能否看出它錯在哪裡、能否撤銷、是否會傷及他人的資料與權益。

下一個產品門檻,是交辦後仍看得見控制權

Altman 的比喻把問題拉回使用者手上:AI 何時能讓人放心把任務交出去,卻不需要把判斷與責任一起交出去?OSWorld 的最佳成績為 66.3%,固定任務集裡仍有 33.7% 沒有成功完成;可靠度要靠每一段流程累積,不能只憑一次展示決定。

現階段挑選 AI 代理工具,可先看三個條件:結果是否容易驗證、錯誤是否能復原、重要操作是否有人工確認點。三項條件都清楚的工作,較適合作為第一批測試;涉及對外承諾、金錢、個資或不可逆異動的工作,則應把自動化停在提出建議與準備草稿的階段。

可量測、可撤回、可追責的流程,能讓使用者判斷手上的工具究竟替自己省下多少工作,還新增多少需要看管的風險。

FAQ:這段訪談對實際採用有何影響?

OSWorld 的 66.3% 成功率,能不能當作日常工作成功率?

OSWorld 的 66.3% 是固定任務集上的基準成績。實際工作還會受資料品質、系統權限、流程例外與人工覆核設計影響,應以自己的任務平行測試。

第一次測試代理人,最適合交辦什麼?

先選資料不敏感、能重新執行、錯誤可撤回且成果容易比對的任務。送信、付款、刪檔與正式對外提交應放在人工確認之後。

資料來源