You are currently at: ejtech.hkej.com
Skip This Ads
Don't Miss

論文基準過時受污染 AI懂操練試題兼作弊

By on August 17, 2026

原文刊於信報財經新聞「CEO AI⎹ EJ Tech——智情筆報

人工智能(AI)產業一直採用量化的基準測試,作為比較模型能力最直觀的方法,一兩個百分點的差距,足以被解讀成技術領先,甚至影響企業採購、媒體報道,以至公司市場估值。不過,隨着頂尖模型集中在高分區,加上題庫被反覆引用、污染或作針對性訓練,這套看似客觀的評分方式開始暴露其限制,模型的分數本身亦逐漸失去意義。真正有價值的問題,應該是哪一間模型,能以較好的框架、更低的成本,以完成現實的工作。

AI公司陸續注意到,基準測試未盡完美,轉為宏觀系統設計競賽。(法新社資料圖片)

模型為求高分用旁門左道

上月在南韓首爾舉辦的國際機器學習大會(ICML),其中一篇論文題為〈當AI基準測試進入平台期〉。作者從AI公司技術報告中,整理出60套常用基準,再拆成14種設計屬性檢驗,結果發現近半已呈現飽和狀態,而且愈舊的測試,失去區辨力的情況也愈明顯。尤其令人意外的是,就算設計者把測試資料藏起來,耐用度都沒有顯著提高,反而由人類專家設計的題目,才算相對比較耐用。

英國人工智能安全研究所(AISI)日前公布的報告,更加發現前沿AI模型之所以能在基準測試取得高分,可能只是來自作弊取巧。接受該所安全能力測試的每一個AI模型,都曾利用題目或是測試環境中的捷徑、規則漏洞,採取明確超出範圍的行動以達成目標。例如,面對其中一個因為設定錯誤,而根本無法正常完成的任務,模型卻會持續尋找旁門左道,甚至跑到公共網絡執行程式,試圖從外部接近評測基礎設施而觸發安全警報。

模型基準測試分數的重要性降低,企業採購標準亦得改變。(法新社資料圖片)

企業採購多衡量實用性

AI公司亦陸續注意到基準測試未盡完美,像OpenAI上月初便詳細稽核了SWE-Bench Pro,估計當中約有三成任務存在問題,建議模型開發者審慎檢視其測試結果;到月底又針對ARC-AGI-3實驗,證明該測試的官方框架(Harness)反而拖低模型分數。另外,月之暗面公布Kimi K3分數資料,更直接把框架寫進比較條件,反映AI公司儘管表面仍很看重基準測試,但已慢慢從單純比拚模型間分數,轉為宏觀系統設計競賽。

隨着模型基準測試分數的重要性降低,企業採購標準自然亦需要改變。過去負責人員只要先看分數排行榜再比較價格,便能選出要使用的模型種類,但是當下AI表現變得更依賴架構設計、推論預算與重試策略,這種做法似乎已經不合時宜。比起在多少個基準測試取得第一位,管理層、投資者以至個人用戶真正要關心的,其實是模型能否用較低成本完成交付的任務,否則它就只是「高分低能」而已。

人工智能必讀好書

書名:The Ultimate Generative AI For Beginners Collection: The 3-in-1 Guide to Learn AI, Deep Learning & ChatGPT in Just Minutes a Day with Hands-On Projects – Even if You’re Not Tech-Savvy

作者:Jordan Blake

簡介:這套書將複雜的人工智能主題分拆為簡單、循序漸進的課程,讓任何人都可以輕鬆學習。

支持EJ Tech

如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們