蓋茨基金會|夥60機構 冀34億人母語用AI 訓練數據英文佔九成 拉低模型準繩率
原文刊於信報財經新聞「CEO AI⎹ EJ Tech」
蓋茨基金會(Gates Foundation)日前宣布,與多間人工智能(AI)企業、研究機構、政府、慈善組織及民間團體,共同發起一項語言平權承諾,希望讓母語在主流AI模型代表性不足的34億人口,未來5年內可直接透過母語使用AI工具。
輝達Anthropic及聯合國等參與
60個參與機構包括Anthropic、OpenAI、輝達(Nvidia)、亞馬遜(Amazon)、微軟(Microsoft)等科企,以及聯合國兒童基金會(UNICEF)、世界銀行、加拿大國際發展研究中心(IDRC)等組織。
蓋茨基金會公告指出,全球約有7000種語言,功能強大的AI卻只有支援其中的小部分,變相令其他語種的民眾為了獲得AI資源,被迫學習那些語言。
此外,由於大量「低資源語言」在模型訓練及測試資料中的代表性不足,令相關使用者面臨準繩率偏低、實用性有限,甚至AI工具無法理解其真實表達等困境。
基金會官方公告更指出,單靠翻譯文字成為更多語言並不足夠,還要改善AI對語音、方言、俚語、慣用語及文化語境的理解;目前主要障礙已非技術本身,而是能否建立高質素的語言數據。
承諾同時強調,要AI真正惠及所有有需要人士,仍須處理數碼基建問題,改善網絡連接、確保電力供應,提高低價裝置的可負擔性和普及程度,否則未必能轉化成實際AI應用。
而蓋茨基金會上星期一份報告提到,大型語言模型(LLM)超過九成訓練數據來自英文來源,導致全球有70億人無法完全享受AI技術帶來的好處。
根據合作框架,參與機構將按自身專長提供不同資源,如建立語言數據集、開發評測標準、研究稀少語言、提供財政資助、改善模型或直接部署應用等。
基金會設秘書處追蹤成員進度
美聯社引述基金會行政總裁蘇茲曼(Mark Suzman)指出,將會「全速推進」相關工作,「即使AI現在停滯不前……仍想繼續構建這些語言數據集,讓它們供現有的AI工具使用。
基金會將設立秘書處追蹤成員工作進度,未來一年制定治理及工作架構,加快推出供開發者使用的數據集、模型與工具,以及在部署過程保障私隱、知情同意和數據主權。
部分參與機構已同步公布具體行動,例如OpenAI計劃針對低資源語言,把改善模型表現列為工作重點,又集中建立語音AI所需的數據及基礎設施,優先處理欠缺商業投資的語言。
支持EJ Tech
如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們。



















