幫AI加監察員,可以少走冤枉路

媒角抵加News/林承志
9 小時前
一名讀者在兩個螢幕前比較AI搜尋路徑與監察角色整理後的線索

媒角抵加/林承志綜合報導)你叫AI找資料、規劃行程或整理報告,第一個線索讀錯,它可能一路換關鍵字,最後交出完整卻答錯題目的結果。8月25日,復旦大學與騰訊團隊公開CAFE預印本:監察角色讀搜尋過程,發現漏掉條件就叫主代理停下並指下一步。7B模型在7組題目的完全答對率,由49.7%升至52.5%。

  • 最常見的錯誤:第一個地名或條件看錯後,AI繼續換搜尋字,卻沒有重看手上的資料。
  • 可以立刻學的分工:主代理負責找資料;監察子代理負責看搜尋紀錄,指出漏掉的條件與下一步。
  • 論文裡的例子:AI一度追著丹佛找步道;重讀Grand Junction的結果後,才答出Old Kiln Trail。
  • 題庫結果:研究者報告,7B模型的完全答對率由49.7%升至52.5%,沒有證據卻作答的比例由17.63%降至12.60%。
  • 人最後要做的事:寄信、花錢、處理個資或對外承諾前,仍由人確認。

查旅遊行程或做報告,第一個條件看錯就會白忙一場

想像你請AI找一條適合全班戶外教學的步道。它列了距離、坡度與景點,看起來很仔細;只要一開始把地點看錯,後面找到的資料再多,也可能全是別的地方的答案。交報告、做比價或找客戶資料時,也會遇到同一種問題。

CAFE論文放了一個相似的搜尋示範。AI要依距離、長度、寬度、爬升和19世紀建物等線索,找出科羅拉多的一條步道。它已在結果裡看到Grand Junction,卻把這個地名當成無用資料,轉而猜目標在丹佛,接著反覆查丹佛附近的步道與地方檔案。

監察子代理看過程,先指出主代理漏了什麼

CAFE的做法像替主代理安排一名監察員。主代理負責查資料;監察角色讀它已經查過的關鍵字、看過的結果和採用的線索,找出哪一個條件被漏掉,再給一個明確的下一步。

論文裡,監察角色提醒AI:Grand Junction已出現在搜尋結果,先重讀這個地理線索,再把步道長度、寬度、爬升和舊石灰窯一起帶進下一次搜尋。主代理改用完整條件查詢,最後找到Old Kiln Trail。監察角色的工作,是在錯誤累積前把它指出來。

今天就能這樣分工:主代理找,監察子代理抓錯

你不必等CAFE變成一個產品。用兩個對話或兩個代理就能試:第一個只負責找資料與保留每次搜尋的來源、條件和結論;第二個只讀這份紀錄,回答三件事:已經確認什麼、漏掉哪個條件、下一步該查什麼。

可以先把規則寫成一句話交給監察子代理:「同一方向找不到新證據時,停止新增關鍵字;找出被忽略的條件,列出已查來源、尚缺資料和一個能核對的下一步。」主代理收到這份回覆後再繼續。這能讓你看見它是資料不夠,還是一開始就找錯方向。

桌上的地圖、來源資料與三組色彩不同的整理紙張,呈現搜尋紀錄、漏掉條件與下一步
AI生成的實景風格新聞概念圖,呈現把搜尋紀錄、漏掉條件與下一步分開交接的工作桌面;非CAFE、復旦大學、騰訊或任何產品的實際操作畫面。

題庫裡的答對率提高,自己的任務要先小範圍比較

研究者用Qwen2.5的7B與3B模型,在7組搜尋題測試這套做法。7B模型的完全答對率由49.7%升至52.5%,F1分數由58.0升至60.7;平均答案編造率由17.63%降至12.60%。這裡的答案編造,是找不到足夠證據,卻仍把話講得像真的。

這些數字來自題庫,最實際的用法是挑一件你常交給AI的任務試跑,例如每週市場整理或旅遊資料蒐集。保留10次沒有監察角色的結果,再和10次有監察角色的結果比較:漏條件幾次、引用錯資料幾次、需要人重做幾次。你才能知道它在自己的資料與規則下幫了多少忙。

人接手會改變別人權益的決定

監察子代理能提醒搜尋方向,仍不能代替負責的人。內容會寄給客戶、牽涉報價、個資、醫療、法律或退款時,主代理與監察角色都要交回來源和理由,由人做最後確認。

這樣分工後,AI不只交出一個答案,也交出它為何走到這個答案。你可以先看它漏了什麼,再決定要它重查、改題目,或停止使用那一批資料。

常見問題

監察子代理一定要用另一個模型嗎?

不一定。CAFE論文讓同一個共享模型輪流扮演搜尋與監察角色。實際試跑時,可用兩個代理、兩段對話,或同一個工具裡前後兩個明確步驟;重點是監察角色必須看得到主代理的搜尋紀錄。

它要監察哪些事?

先看主代理採用的條件、已看過的來源、重複出現的搜尋方向與尚未回答的問題。回覆時只交代漏掉的條件、一個能核對的下一步,以及何時該停下來交給人。

CAFE現在可以直接下載嗎?

截至8月27日,公開材料以論文與題庫結果為主,未見研究團隊提供可直接開帳號使用的服務。讀者可先把監察流程用在現有工具裡。

資料來源與更新紀錄

  • 2026年8月25日:CAFE的公開日期、研究摘要與測試範圍,參考 arXiv論文摘要頁
  • 2026年8月27日查核:CAFE的步道示範、要求提示方式、訓練過程、完全答對率、F1與答案編造率,參考 CAFE論文全文
  • 2026年8月27日查核:文字回饋協助語言代理調整後續嘗試的學術背景,參考 Reflexion論文摘要頁
  • 2026年8月27日查核:目前維護型實作與公開Demo的獨立整理,參考 OpenTrain技術頁