研究發現 ChatGPT 能在受試者參加前 預測人格測試結果

台灣產經新聞網/台灣產經新聞網 新聞中心
20 分鐘前

【新聞中心/綜合外電】一項於週四發表於 Cell Press 旗下期刊《iScience》的研究指出,GPT-4 能夠從任意來源文本建構人格評估問卷,並在任何人實際作答之前,準確預測受試者的回答結果。

ChatGPT可生成心理測驗 甚至在人類作答前預測群體反應

研究揭示AI內建心理模型

生成式人工智慧不只會寫文章、回答問題,最新研究顯示,ChatGPT甚至能根據一段文字建立人格測驗,並在人類受試者實際作答前,預測整體答案分布及題目之間的關聯。這項由耶路撒冷希伯來大學研究團隊主導的研究,已刊登於Cell Press旗下期刊《iScience》,凸顯大型語言模型(LLM)可能在訓練過程中,無形間吸收了人類心理與人格結構。

研究主持人Rotem Monsa表示,人格特質會反映在日常語言中,因此大型語言模型可能「將人類心理的結構,視為學習語言的自然副產品而吸收」。他指出,模型雖然未被特別訓練成心理學專家,但心理學與人格理論所蘊含的語言模式,可能早已存在於其訓練資料之中。

DSM-5與星座文本接受測試

研究團隊以GPT-4建立兩套人格問卷,第一套以《精神疾病診斷與統計手冊》第五版(DSM-5)中有關人格障礙的內容為基礎,另一套則取材自星座及占星學書籍。研究人員刻意選擇科學基礎差異極大的文本,以測試AI是否能從不同來源中擷取具心理意義的資訊。

Monsa說,DSM-5經過數十年臨床研究修訂,是全球精神醫學界廣泛使用的診斷手冊;相較之下,占星文本雖然描述大量人格特質,卻具有強烈文化色彩,並未經過科學驗證。以DSM-5為例,問卷要求受試者以1至5分評估自己是否「經常懷疑他人動機」或「容易信任他人」等敘述。

研究團隊隨後邀請600名成年人填寫兩套AI生成問卷,並與廣泛使用的「大五人格量表」(Big Five Inventory,BFI)進行比較。結果顯示,DSM-5問卷在不同人格群組內具有高度內部一致性,彼此在現實生活中通常相關的特質,例如逃避與依賴,也在受試者的答案中呈現相近關聯,整體表現接近BFI。

星座問卷不具一致性仍能預測結果

占星問卷則呈現不同結果。研究發現,依照星座或四元素歸類的特質,並未在人類樣本中形成一致的心理向度。Monsa指出,研究資料顯示,被歸在同一火象元素下的特質,實際上未必會在人群中同時出現,因此占星架構本身缺乏穩定的心理測量一致性。不過,令人意外的是,兩套問卷中的個別題目,都能用來預測憂鬱、焦慮及幸福感等生活結果,準確程度與BFI相近。研究團隊認為,這可能不是因為星座分類本身具有科學效力,而是ChatGPT從占星文本中擷取的部分人格描述,仍包含與真實心理狀態相關的語言訊號。

未取得人類資料已預測答案

研究最受矚目的發現,是ChatGPT在受試者填寫問卷之前,就已預測兩套問卷的平均答案,以及各題目之間可能出現的相關性,而且預測結果與實際調查資料高度接近。換言之,AI不只負責產生題目,也能在零人類作答資料的情況下,先行估計群體可能如何回答。

Monsa表示,在尚未看過任何人類資料前,大型語言模型就能預測人類反應模式,代表模型可能已從大量語言資料中觀察到某些普遍且有意義的心理規律。他說,這些結果顯示,LLM不只是內容生成工具,也可能成為評估自身產出的研究工具。

跨文化應用仍有待驗證

研究團隊強調,目前結果不能直接等同於ChatGPT具備臨床診斷能力,也不能用來取代專業心理評估。研究方法未來若要應用於醫療、人才選拔或市場調查,仍須經過更大規模的樣本、獨立驗證及倫理審查。

研究作者也提醒,相關結果可能高度受語言與文化影響。由於現有大型語言模型的訓練資料主要來自英語及西方社會,換成其他語言或非西方文化後,預測能力未必能維持相同水準。Monsa表示,研究團隊已開始測試不同語言的模型表現,後續結果將有助判斷AI所掌握的究竟是普遍心理規律,還是特定文化中的語言與人格模式。

 
*圖片為 AI生成示意圖。圖文歡迎轉載引用,請標註來源