Don't Miss
AI趨勢|評估大模型耗時長成本趨增
By 信報財經新聞 on August 17, 2026
原文刊於信報財經新聞「CEO AI⎹ EJ Tech」
在人工智能(AI)模型能力不斷進步的同時,一個較少受注意的成本問題逐漸浮現,就是評估AI表現的代價也在增加。過去的測試往往只需要準備固定題庫、比對標準答案,可是隨着AI嘗試解決其他更複雜的問題,評估工作亦逐漸變成複雜工程,需要人類專家介入審查及驗證。
單次運算支出達8萬
Anthropic年初一份報告直言,人類專家評估的弱點是「昂貴」、「緩慢」,以及在大規模評估時不易獲得足夠人員支持。模型評估與測試機構(METR)上月一項研究甚至提到,想要詳細測試AI代理表現,單次評測可以歷時5天之久,模型應用程式介面(API)、圖像處理器(GPU) 運算等支出,最高可達一萬美元(約7.8萬港元)。
這一問題在專門領域特別嚴重。菲爾茲獎得主陶哲軒早前表示,近年AI發現眾多數學新解,人類反而面臨「驗證樽頸」,無法仔細評估AI答案。學界有人正在進行First Proof項目,但光是處理AI對10條問題的答案,便已經要動員約30位數學家參與審閱,可見要證明AI結果對錯殊非易事。
相關文章:論文基準過時受污染 AI懂操練試題兼作弊
支持EJ Tech
如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們。


















