數發部主權AI訓練語料庫 納客語.原住民語
客家電視台/劉宜頻 蔡奕輝 臺北
342 天前
AI時代來臨,為了強化臺灣在人工智慧領域的自主性,數位發展部啟動主權AI訓練語料庫計畫,6月開始跟各部會合作,盤點現有的語言資料,並確定將客語及原住民族語等納入範圍,學者對此表示肯定,不過也擔憂官方現存的錯誤語料,若是沒有檢視修正,恐導致錯誤世代延續,對學習者造成誤導。
AI時代來臨,相關應用越來越廣泛,數發部啟動主權AI訓練語料庫,並確定納入客語及原住民語,6月開始除了訂定授權條款,也將辦說明會,要求各部會盤點各項語言資料,預計2、3個月內,展開第一階段語言資料釋出。
數發部資料創新司司長 莊明芬:「資料必須就是跨平台,然後再來就是跨領域的共享,其實它才可以發揮它更大的價值,單一的一個平台讓各界可以來做運用,我想這樣對使用者來講,或是對未來的AI開發者來講,應該是會比較方便,然後而且也能夠展現出,資料集結在一起的這個價值。」
民進黨立委 徐富癸(2025.06.18):「語料的一個來源,偏重在一個中央政府的文書,會造成一個語境的局限,甚至地區的一個偏誤。」
日前民進黨立委徐富癸指出,語言資料偏重政府文書資料,擔心出現語料偏誤,長期研究客語的學者徐兆泉也直言,教育部客語字典就收錄大量錯誤詞彙,若未先檢視修正,直接收錄至AI語料庫,恐讓錯誤世代延續,對學習者造成誤導。
「背心我們說裌仔,它說背心,這個操場我們應該說運動坪,它說操場。」
客語專家 徐兆泉:「一定要我們製、這個製作的人,制定的人要把它弄正確,這樣才,他們有根據去學習,所以這是非常非常重要的一點,如果我們沒有做好,這樣放進去AI裡面,這是千年萬年事情,放進去後客家人就照著這樣做,這樣不對的東西要怎麼辦。」
學者呼籲主管機關,應該正視使用正確客語字的重要性,數發部則表示,會要求各部會對語料品質進行初步把關,但也坦言,AI資料難免有誤,使用者仍需查證比對。