OPEN AI的怪物已經在門口

媒角抵加News/林承志
9 分鐘前

工程師讓 Codex 讀程式、找失敗測試、改檔再重跑;工具回傳與修正都留在同一串對話裡。任務走到幾百輪,聊天視窗已成為一份可接續的工作紀錄。

OpenAI 工程端 8 月 15 日公開一個 741 輪、231MB 對話的內部測試,平均開啟時間由 27.62 秒降至 1.66 秒,並擴大子代理模型調度。團隊可用一張工單交代:誰讀資料、誰改檔,最後由誰確認。

關鍵資訊 內容
事件主角 OpenAI、ChatGPT 與 Codex
內部案例 741 輪、231MB 對話平均開啟時間由 27.62 秒降至 1.66 秒
效能改版 對話載入項目由 15,529 筆降至 64 筆;網路請求由 894 次降至 16 次
代理調度 Multi-Agent v2 可將子任務委派給支援模型,包括 Luna
人工仍握住的動作 任務範圍、資料權限、驗收、部署與對外發布
台灣團隊的試跑起點 一項有測試、可回滾、成果能自行核對的固定工作
產品狀態 多代理調度已公開;超長對話效能改版由 OpenAI 工程端預告將推出

一個 AI 任務會留下數百輪紀錄

741 輪已超過單次問答的範圍。代理人讀取檔案後,可能呼叫搜尋工具、取得錯誤訊息、改寫檔案、跑測試,再把結果交回主代理。每一步都增加程式片段、工具輸出、附件與待辦事項;使用者回到這串對話時,也得找回先前的判斷與下一個動作。

OpenAI 工程人員 Andrew Ambrosino 公開的圖表把這個案例列為 741 輪、231MB 對話。平均開啟時間由 27.62 秒降至 1.66 秒,整體應用程式記憶體成長由 1,030.7 MiB 降至約 606 MiB。這隻「怪物」指的就是一份持續累積的 AI 工作紀錄:它有任務脈絡、工具輸出、修正過程,也需要隨時能被人接手。

長對話改版縮短的是回到工作現場的等待

圖表同時列出網路請求由 894 次降至 16 次,載入的對話項目由 15,529 筆降至 64 筆。這些指標描述的是打開長對話時的資料讀取與畫面渲染;使用者先感受到的變化,會是回到舊任務、檢視工具紀錄與尋找前一次決策的速度。

OpenAI 員工 Ananth 在 8 月 15 日的公開貼文中稱這項 ChatGPT 效能改版將於下一週推出。圖表只公布這個極端案例的平均值,沒有列出裝置、瀏覽器與不同長度對話的結果。團隊在自己的工作環境試跑時,可記錄三個數字:打開舊任務花多久、瀏覽器記憶體用了多少、能否迅速找到上一次測試結果。

Multi-Agent v2 先讀工作單,再分派模型

OpenAI 工程端 8 月 15 日表示,具備 Multi-Agent v2 的模型可將工作委派給任一支援模型,包括 Luna。Greg Brockman 轉貼時提到,產品正朝減少手動選模型的方向前進。

主代理能先讀取任務,把檔案搜尋、資料整理、測試或程式修正交給子代理,再把結果彙整回來。OpenAI 的 GPT-5.6 公告也將 API multi-agent 列為 beta,可平行執行子代理並在一次請求中整合結果;Codex 使用者仍可依帳號方案選擇 Sol、Terra、Luna 與推理強度。

工作單因此成為第一道指令。它要先說清楚任務目標、可讀資料、預期輸出與停止位置,主代理才知道哪些工作能拆開,哪些結果需要留給人決定。

一張工單先寫清楚四件事

第一,寫出完成畫面。例如「找出付款模組失敗的測試,交回涉及的檔案、修正差異和重跑結果」。這樣的任務有可見輸出,也能讓接手的人立即判斷是否完成。

第二,列出資料範圍。工作單應標示可讀取的資料夾、可用的工具、不能改動的設定檔,以及中止條件。代理人讀取資料的範圍愈清楚,子任務愈容易交接。

第三,保留人工確認的按鈕。分析、搜尋、整理與草稿撰寫可先在隔離環境進行;寄信、扣款、刪除資料、部署版本與公開發布,交由負責人確認。

第四,要求每個子任務交回紀錄:做了哪些動作、改了哪些檔案、測過哪些條件、還留下哪些疑問。主代理負責彙整,需求負責人用這些內容對照原始工作單。

台灣團隊先拿每週固定工作試跑

第一次不必選最複雜的專案。可從每週都會出現、已有測試與回復方法的工作開始,例如找出既有程式庫的失敗測試、整理一批公開資料的版本差異,或把客服回覆依固定規則分類成草稿。負責人先寫好資料夾範圍、測試指令、交付格式與人工確認點,再讓代理人執行。

這種試跑會留下一份可以比較的紀錄:原本花多少時間、代理人做了哪些步驟、哪裡需要人介入、最後產出是否可用。下一輪才能調整任務大小、子代理數量和模型選擇。OpenAI 對 Codex 的模型與推理強度採帳號方案分級,台灣團隊也應先在自己的帳號確認可用模型、用量額度與工具權限。

最後確認權留在看得懂後果的人手上

多代理同時處理工作,能讓資料搜尋、測試和草稿整理一起前進。對外寄送、付款、資料刪除與部署,則會把後果帶到客戶、系統或網站上。這些按鈕要由看得懂需求、資料與後果的人按下。

OpenAI 的長對話測試與多代理調度,讓 AI 工作逐漸長成一套可追蹤的任務流程。團隊現在開始保留任務定義、資料範圍、工具清單、測試結果與最終決定,就能在代理工作愈來愈長時,知道哪一步交給機器,哪一步需要人承擔。

常見問題

「16倍」指的是模型回答變快嗎?

這組數字來自一個 741 輪、231MB 對話的平均開啟時間,由 27.62 秒降至 1.66 秒。圖表列出的是對話載入、畫面渲染、記憶體與網路請求,未列出模型生成答案的速度。

Multi-Agent v2 已經讓每個使用者不用選模型了嗎?

OpenAI 工程端已公開子任務委派給支援模型、包括 Luna 的能力。官方產品頁仍列出 Codex 的模型與推理強度選項,實際可用模型會隨帳號方案、版本與後端設定不同。

第一次試跑要交給代理人什麼工作?

選一項有測試、可回滾、輸出能自行核對的固定工作。先限定資料範圍與工具權限,再要求代理人交回程式差異、測試結果、資料來源或回覆草稿;部署、寄送、付款與發布由人完成最後確認。

資料來源與更新紀錄