〔記者邱巧貞/台北報導〕生成式AI快速發展,模型是否真正理解台灣文化與觀點,關鍵之一就在訓練語料。數位發展部資料創新司司長王復中今(15)表示,「臺灣主權AI訓練語料庫」自去年12月推動至今,資料集數量已從約2,000個增加至逾5,000個,Token數更從6億增至21億,語料規模成長逾3倍;隨著政府資料累積至一定程度,下一階段將進一步擴大民間語料徵集,納入更多出版社及創作者的高品質原創內容。

王復中表示,隨著AI發展愈來愈快、功能日益強大,外界也開始關注AI究竟使用哪些資料進行學習與訓練,以及AI對不同語言、文化的理解程度,因此各國都相當重視自主、安全、可靠及具韌性的AI能力。

數發部建置「臺灣主權AI訓練語料庫」,目的之一就是希望AI在面對一本著作時,不只是透過外界評論或幾句摘要來理解內容,而是能更完整認識作品所要表達的核心思想,進一步理解台灣文化與觀點。

王復中指出,臺灣主權AI訓練語料庫自去年12月推動至今,採取「先政府、再民間;先中央、再地方」策略,目前資料集數量已從約2,000個增加至5,000個,Token數則從6億增加至21億,整體語料規模成長逾3倍。

目前語料內容涵蓋民俗、語言、生物、旅遊、出版品、法律、藝術、文化、經濟、地理、交通、醫療、歷史等不同領域,也納入本土語言。數發部希望透過持續擴充語料,提供生成式AI業者及技術團隊發展所需應用,讓AI更貼近台灣文化及不同領域的內容。

隨著政府資料累積至一定規模,數發部也將語料來源進一步從政府擴大至民間。王復中表示,民間擁有相當豐富的資源,尤其出版社所擁有的書籍,在內容深度及品質上具有價值,因此目前針對電子書、著作、書籍內容及書籍簡介等不同形式進行徵集,希望納入更多優質且具原創觀點的作品。

民間語料徵集機制採取「自願參與、明確授權、可退出」原則,在資料提供者自願的前提下取得明確授權,相關高品質語料未來可提供政府機關、民間團體及學研單位等資料應用端使用,包括模型訓練、微調、檢索增強生成(RAG)及知識萃取等,並可進一步應用於教育學習、行政輔助、智慧客服及專業諮詢。

至於外界也關注提供的語料是否會經過事先的內容審查,王復中說明,民間徵集主要由出版社負責篩選及品質把關,平台本身則針對內容結構、資料格式是否正確,以及資料能否順利供AI訓練等項目進行檢核,不會對內容本身進行干預。

在參與方式上,王復中表示,網站已設計三階段流程,資料提供者登入並申請帳號後,即可進行資料上架;完成後,平台將針對資料內容、格式及相關資訊進行檢核,整體流程則盡量簡化(https://taic.moda.gov.tw/content/application-guidelines?utm_source=chatgpt.com)。