Don't Miss
月之暗面|模型評分險勝 整體性能落後
By 信報財經新聞 on July 21, 2026
原文刊於信報財經新聞「CEO AI⎹ EJ Tech」
據月之暗面公布,Kimi K3在程式工程、瀏覽代理、辦公任務多個基準測試進入第一梯隊,部分項目以極窄差距奪冠,如於Program Bench取得77.8分,略高於GPT-5.6 Sol的77.6分及Claude Fable 5的76.8分。
不過,在官方測試過程裏,各模型、項目採用不同代理框架(Harness),即未有全部置於同一運作環境,故實際是量度模型配合代理框架最佳表現,而非直接比併每個模型本身能力差距。月之暗面公告坦言,K3整體性能「仍然落後於最強大的閉源模型」、「用戶體驗跟Claude Fable 5及GPT-5.6 Sol有差距」,承認K3對思考過程高度敏感,若代理框架未完整回傳推理紀錄,或在同一工作階段切換模型,將拖低工作表現。
更消耗詞元 幻覺率增至51%
第三方評測平台Artificial Analysis指出,K3思考速度略慢,消耗詞元(Token)額度偏高,價格亦不特別便宜;相較上一版本K2.6,儘管K3答案正確率由33%升至46%,幻覺率卻從39%增至51%。
支持EJ Tech
如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們。



















