You are currently at: ejtech.hkej.com
Skip This Ads
Don't Miss

合成數據 原地內捲(車品覺)

By on August 26, 2026

本文作者車品覺,為港交所獨立非執行董事、香港基因組中心董事、香港大學中國商業學院客座副教授,為《信報》撰寫專欄「全民大數據」

大部分領先智能公司在建立數據體系時,信奉一條鐵律:數據是生產要素,誰的數據多、誰的數據好,誰的模型就強。

直到2024年圖靈獎得主、強化學習之父理查德.薩頓(Richard Sutton),在播客裏澆下一盆冷水:合成數據是「一個重大的錯誤」,而當前的大型語言模型,可能只完成了完整智能的四分之一。

查德.薩頓在播客裏澆下一盆冷水:合成數據是「一個重大的錯誤」,而當前的大型語言模型,可能只完成了完整智能的四分之一。(網上圖片)

這句話值得認真對待,不是因為說話的人掛着圖靈獎,而是因為它戳中了看着這個行業長大30年的我,心裏一直隱隱不安,我們以為在加速,其實一直在原地打轉。

大模型能力的提升,靠的是一條公式:更多參數+更多數據=更強模型。但互聯網上的公開優質文本正在枯竭,於是各間實驗室想出一個「聰明」的辦法,讓AI自己生成數據來「餵」AI,這就是合成數據。

薩頓用他多年研究的「大世界假說」(Big World Hypothesis),戳穿了它:真實世界無限複雜,複雜程度遠超任何智能體,也遠超任何模擬器。任何由有限規則拼出來的合成世界,相對於真實世界都微不足道。這像說:你在一個自己框死的小水池裏養魚,養得再多,也只是那幾條在轉圈。自動駕駛在仿真場景裏跑完百億公里,一上真實道路,碰到雨雪、突發路況照樣失靈。更關鍵的是,依賴合成數據的AI,本質上是在自己教自己。這正是我反覆提及的「養用循環」的反面──養是積累,用是實踐,沒有「用」的閉環,養就是一個自閉系統,數據量在暴漲,實則原地「內捲」。

大模型缺的不是知識,是「用」的那四分之三,正如薩頓說大模型只覆蓋了智能的20%或25%,這是個有衝擊力的判斷,卻指向真的問題。完整的智能至少有四塊:

1)語言理解:大模型最擅長,這一塊它做得確實好。

2)感知:多模態能「識別」物體,卻難「理解」物理環境背後的因果。

3)行動與規劃:它能輸出方案,卻沒有實際去試錯、驗證因果。

4)持續學習:最核心、也最缺的一塊。

這解釋了大模型談理論頭頭是道,一落地真實場景就翻車,因為真實場景要的不是調取知識,而是感知、行動、試錯、學習。

薩頓不是否定大模型,他的方向是回歸真實世界,持續自主學習。不再「訓練一次、終身使用」,而是用一次、精進一次。這正是我在《決戰大數據》書中說的養用循環──用是養的驗證,養是用反饋回來修正方向。

以後怎麼判斷AI是否進步,先問以下幾個問題:數據來自真實世界還是合成世界?上線後還能不能持續學習?有沒有感知與行動的閉環?是在算力內捲,還是人機協作?這個比任何排名榜,都更能說明一個系統的真實潛力。

( 信報新書推薦:車品覺新作《全民AI︰人機協作必備攻略》,VIP特惠$166書)

( 點擊購買 實體書電子書 )

更多車品覺文章:

支持EJ Tech

如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們