GPT-6 Astra 99.9%代表什麼?首日實測

媒角抵加News/林承志
1 天前
三座相連的透明玻璃工作槽放在深色工作檯上,一條藍色路徑穿過三個槽體並通向右側的亮點。

媒角抵加/林承志綜合報導)GPT-6 Astra 首日最吸睛的數字,是 ARC-AGI-3 的約 99.9%。ARC Prize 同時列出兩組成績:Astra 在同一 Semi-Private 測試的 Standard harness 最佳成績為 62.7%;可保存不公開推理狀態、並為長對話做壓縮的 Provider Adapter harness,最佳值約為 99.9%。這個高分描述的是模型連同可延續工作狀態的代理架構,在陌生互動任務中的最佳表現。實際工作仍要回到文件、程式與工具流程的驗收結果。ARC Prize 的結果頁方法說明列出了兩種條件與基準範圍。

第一批公開心得的正面訊號集中在後端工程、電腦操作與長對話連續性;早期測試者同時提到速度、視覺表現、任務切分與長時間協作。Astra 的首日檢驗重點,落在它能否把長任務中的狀態延續,轉成可交接、可驗收的工具型工作成果。

  • 99.9% 怎麼讀:它是 Provider Adapter harness 下的最佳觀察值;同一測試的 Standard harness 最佳值是 62.7%。
  • 首日口碑看見什麼:早期使用者特別稱讚電腦操作、後端工程與長對話的記憶連續;對較長的自主專案仍會要求人安排角色、節點與驗收。
  • 外部基準是否一致:Artificial Analysis 的 Coding Agent Index 對 Astra 較有利,但其整體 Intelligence Index 與 GPT-5.6 Sol 同為 61,且部分工作類評測沒有同步上升。
  • 讀者該怎麼判斷:以同一個有完成定義的任務,分別記錄交件、人工接手與失誤步驟。

ARC-AGI-3 的 99.9%,測的是什麼?

ARC-AGI-3 讓系統在陌生、互動的環境裡觀察規則、建立因果模型,再選擇行動以完成目標。ARC Prize 說明,這套測試著重探索、建模、設定目標、規劃與執行等過程,評量代理在互動中修正策略的能力。測試環境採用確定且封閉的機制和目標;文件、程式庫、企業權限與變動中的網頁服務,則是另一組更開放的工作條件。ARC Prize在文章中界定了這個範圍。

這次受討論的關鍵在於兩個 harness。Standard harness 讓模型自行把可見筆記帶往下一輪;Provider Adapter harness 則保留模型的 opaque reasoning state,並在長對話使用 compaction。前者可理解為模型須更依賴自己留下的工作筆記;後者則讓它能延續更多先前推理與上下文。ARC Prize 列出的最佳結果因而相差明顯:Standard harness 為 62.71%,Provider Adapter harness 為 99.95%。

圖表中的「99.9%」描述 Astra 搭配可保留工作狀態的代理架構,在這一類互動任務的最佳表現。首日 Reddit 討論則把焦點放在高低兩組數字如何分別反映模型能力與整個 agent harness 的設計。討論串呈現了這個問題。

Tibo 的貼文為何讓「Astra shock」成為首日話題?

使用者提供的 Tibo @thsottiaux 貼文截圖裡,除了「網路各角落都感到 Astra shock」的描述,還把 ARC-AGI-3 約 99.9% 的成績與人類平均約 48% 並置;圖說也寫明測量使用了能保留過去推理與訊息的 Responses API harness。另一則貼文則表示,團隊正加速處理尚未使用 Astra 的付費用戶,並提到按等待日數給予 banked reset

這些貼文呈現兩個首日訊號:產品討論的重心已從單純聊天品質,轉到「能否帶著狀態持續完成陌生互動任務」;熱度也同時帶來存取壓力。banked reset 是 Tibo 在回應等待情況時使用的名稱;貼文把這個等待感、基準成績與長任務期待放在同一波溝通裡。

早期使用者稱讚哪些地方,又保留了什麼?

Something Big 創辦人 Matt Shumer 在取得早期存取後的長篇實測中,將 Astra 的亮點放在後端工程、電腦操作、長對話連續性與多代理協作。他寫到,系統在瀏覽器與日常軟體的操作更能保留偏好,長對話壓縮後也較少需要重新交代背景;這是單一測試者在自己的工具、權限和任務配置下的觀察。Shumer 的完整實測也把它描述為他較願意放手讓系統處理電腦工作的模型。

Shumer 的實測也列出速度、視覺品味與長時間協作的條件。他認為 Astra 仍偏慢;在視覺品味與素材製作上,他會選其他模型。越長、越有野心的任務,越需要人先定義協調者、分工點、中止條件與驗收方式;缺少這些安排時,任務容易在細節裡打轉。於是,「能跑很久」與「能可靠交件」形成兩個不同的觀察指標。

其他首日社群討論也把問題延伸到創意寫作:長文能否維持角色語氣、會不會沿用陳腔濫調。公開案例目前多集中於電腦使用與代理式程式工作;創作類的可比較長期回饋仍在累積。OpenAI 的模型文件把電腦使用、程式、研究與專業工作列為 Astra 的主要定位,各種工作類型會呈現不同的驗收標準。

俯視淺色工作檯,左側四張紙卡以分段線條記錄路徑,右側四層透明片以一條連續藍線串接並通向底部的金色標記。
AI 生成概念圖,非 OpenAI 或 ARC Prize 的測試介面。左側紙卡分段帶入記錄、右側透明層保留連續路徑,對應本文所述兩種工作狀態延續的測試方法。

獨立基準呈現不同工作類型的差異

Artificial Analysis 的 Astra 評測列出不同工作類的並列結果。其 Coding Agent Index 為 67,將 Astra 放在與多個同級競品相近的水準;同一報告則把 Astra 的 Intelligence Index 列為 61,與 GPT-5.6 Sol 相同,低於 Fable 5.1 的最高設定。報告還提到,Astra 在較長時程的 AA-Briefcase 測試表現較佳;簡報工作與 GDPval-AA v2 等工作類評測則呈現較低分數,部分項目回落。

程式代理、長時程推理、簡報產出與行業任務,分別考驗模型的記憶、工具選擇、速度、格式控制與錯誤恢復。ARC-AGI-3、Coding Agent Index、早期使用者的長跑任務,因而各自提供不同的能力切面。

要判斷 GPT-6 Astra 是否真的有用,先看四件事

團隊或個人可拿一個熟悉、且有明確完成定義的任務來比較。任務可以是整理一組文件並交出差異表、在測試環境修正一個可重現的程式錯誤,或依固定規格完成一段多步驟的網頁檢查。比較時分開記錄四件事:

  1. 交付是否可驗收:結果能否直接與來源資料、測試結果或既定格式比對。
  2. 長任務是否不掉脈絡:中間被補充資訊或被要求修正後,是否仍記得先前已確認的限制。
  3. 人要接手多少次:記下人工重寫、選擇或攔截發生的步驟。
  4. 錯誤會不會被自己發現:模型能否在工具輸出、畫面變動或資料不一致時停下來查證,而非把錯誤一路帶到交件。

四項結果描繪的是實際工作價值。需求變動後能否正確交接、工具失敗後能否復原,尤其適合觀察 Astra 如何把工作狀態帶過長任務。這些情境中的人工監督量與交件品質,會決定較高基準分數能否轉成可交付的工作成果。

常見問題

GPT-6 Astra 的 ARC-AGI-3 99.9%,是否證明它已經是 AGI?

99.9% 是 Provider Adapter harness 下的最佳觀察值,測試條件包含保留不公開推理狀態與長對話壓縮;相同測試在 Standard harness 的最佳值為 62.7%。ARC Prize 將 ARC-AGI-3 定位為陌生互動環境中的代理能力測試,環境範圍與現實世界的開放複雜性不同。這項結果呈現代理式互動能力的進展;AGI 是否成立,仍是另一個需要先界定標準的問題。

第一批使用者覺得 Astra 擅長什麼?

公開的早期心得多稱讚後端工程、電腦操作、長對話連續性與代理協作。這些回饋來自特定使用者的工具、資料和驗收流程。速度、視覺品味,以及長時間任務需要多少人設計和監督,是反覆被提到的觀察條件。

為什麼同一個模型會有 62.7% 和 99.9% 兩個 ARC-AGI-3 成績?

兩個數字來自不同的 harness。Standard harness 只讓模型帶入它自行保存的可見筆記;Provider Adapter harness 還會保留模型不公開的推理狀態,並在長對話使用壓縮。兩者都是公開列出的結果,但回答的是不同問題:前者更接近有限工作記憶下的表現,後者則包含更完整的代理工作狀態延續。

資料來源與更新紀錄

  • 2026 年 9 月 2–3 日:ARC-AGI-3 的兩種 harness、結果與基準範圍,參考 ARC Prize 結果頁方法文章
  • 2026 年 9 月 3 日:Astra 的官方能力定位,參考 OpenAI API 模型文件
  • 2026 年 9 月 3 日:早期使用者對電腦操作、長對話、協作、速度與視覺工作的觀察,參考 Matt Shumer 的實測;內容為其個人測試心得。
  • 2026 年 9 月 3 日:不同工作類與代理基準的交叉結果,參考 Artificial Analysis
  • 2026 年 9 月 4 日:首日社群爭點,參考 r/singularity 討論;討論聚焦模型與 harness 如何影響 ARC-AGI-3 成績。
  • Tibo @thsottiaux 的首日貼文:使用者提供的兩張截圖,內容包括 Astra shock、ARC-AGI-3 圖表與 banked reset