數發部民間語料徵集計畫 豐富本土語料資源

客家電視台/黃凱靖 徐榮駿 臺北
20 小時前
AI科技持續發展,不過國際上不少AI模型,大量採用中國網路語料訓練,導致臺灣觀點相對缺乏,數發部先前推出,臺灣主權AI訓練語料庫,現在更推動民間語料徵集計畫,希望能夠蒐集到更多臺灣本土的語料資源。 數發部先前推出臺灣主權AI訓練語料庫,希望能夠提升AI模型,對臺灣在地語言、文化,還有生活情境的辨識力,現在數發部進一步推動民間語料徵集計畫。 數發部資料創新司長 王復中:「內容的多元跟豐富,那包括這邊舉例的,不管是文化、藝術、語言,那我們也有不同的語言,包括我們的台語、我們的客語,甚至未來我們在即將,我們會納入的原住民語,都是我們這個語料庫裡面的一個部分。」 在AI時代,不少國家都積極投資,及建立自己的主權AI,不過以華語來說,國際上的大型語言模型,大多是使用來自中國的無版權語料,進行後續的訓練,因此數發部先從政府單位開始,蒐集來自本土的語料,現在更鼓勵民間,提供具有臺灣觀點的資料以及著作。 數發部長 林宜敬:「對於那個客語的資料,還有原住民語的資料,我們都非常有興趣,但是我們這個事情,現在剛、才剛剛開始,那我們現在就是,有各種語料我們都歡迎,但是我們現在是以這個,出版社出版的這個書為主,這個語料徵集是志願性的,就是作者把他的語料開放出來,有一個好處就是可以讓世人,更清楚地了解他的作品。」 臺灣主權AI訓練語料庫,從一開始的6億個詞元,到目前已經超過20億個,不少民間出版社與作家也簽署授權,跟數發部合作訓練AI語料,未來也有機會擴大到客語、河洛語及原住民族語,讓臺灣語言文化也能透過AI傳遞到全球。