整理/鄭宜芬
為厚植臺灣在地文化與語言的 AI 實力,數位發展部推動的「臺灣主權 AI 訓練語料庫」近日與客家委員會合作,正式上架客家語言資源、出版品、文史典藏及研究報告等多項珍貴內容,首度新增約 2,000 萬 tokens 的高品質訓練語料,為臺灣主權 AI 語料注入更豐富的多元文化與語言生命力,並有助於提升 AI 對客語及客家文化的理解能力,支援客語智慧客服、教育學習等多元應用。
[ 加入 CIO Taiwan 官方 LINE、Facebook 與 LinkedIn,與全球 CIO 同步獲取精華見解 ]
客語作為我國國家語言之一,承載著深厚的歷史與文化底蘊。此次客委會提供的語料內容主要涵蓋:詩集創作、客家風情及客語教學圖書等政府出版品;客語能力認證各級詞彙教材與題庫、口語採錄文本、文化典藏,以及學術與政策研究資料,如客語復振、政策發展與文化治理等。
數發部指出,語料內容不僅展現我國客家文化保存的豐碩成果,更有助於提升 AI 模型對客語不同腔調、語意及文化脈絡的理解與生成能力。未來將可廣泛應用於客語智慧客服、本土文化知識服務及公共政策等 AI 創新應用。
數發部表示,「臺灣主權 AI 訓練語料庫」自上線以來,已累積逾 15 億 tokens 語料量,將持續攜手政府機關釋出優質語料,同時深化公私協力,規劃推動民間語料徵集,逐步建構具臺灣主權代表性與專業知識的資料基石。目前該批客語語料已正式上架,數發部歡迎 AI 模型開發團隊、學研機構及相關單位至「臺灣主權 AI 訓練語料庫」官網(https://taic.moda.gov.tw)申請使用,共同驅動客語 AI 技術的蓬勃發展與多元應用落地,也歡迎各界將研究成果、應用案例及更多具臺灣特色的優質語料回饋至語料庫,讓更多創新想法持續發芽,共同壯大臺灣主權 AI 。
(本文授權非營利轉載,請註明出處:CIO Taiwan)














