You are currently at: ejtech.hkej.com
Skip This Ads
Don't Miss

智能叛變?|GPT報告披露入侵平台細節

By on August 28, 2026

原文刊於信報財經新聞「CEO AI⎹ EJ Tech

OpenAI發表長達37頁的技術報告,詳細說明其人工智能(AI)模型ChatGPT如何於上月成功入侵AI開發者平台Hugging Face,並把此事件定性為「前所未有的網絡安全事件」。

圖為Hugging Face行政總裁德朗格(Clément Delangue)。(X影片擷圖

700代理合謀攻擊Hugging Face

報告概述OpenAI一個在沙盒環境的AI代理,因在測試時遇到無法解決的ExploitGym任務,它開始探索周遭環境,尋求作弊的方法。結果,AI代理發現了一個未經批准建立的留言板,上面有超過1000個AI代理交流資訊,其中700個後來利用先前未知的漏洞,參與攻擊Hugging Face。模型首先入侵Artifactory軟件包管理工具,以取得網絡存取權限,隨後更入侵OpenAI、Hugging Face及其他供應商平台的多個系統。

研究人員發現,模型行為存在4種不對齊模式,分別是獎勵破解、堅持執行看似不可能的任務、未經授權的通訊,以及代理之間互相採用目標。其中「獎勵作弊」由來已久,AI代理以非預期方式完成任務,務求更容易獲得更高的獎勵。即使任務看似無法解決,AI代理也很少「放棄」評估任務。隨着AI代理投入更多推理精力,部分開始採取高風險的越界策略,最後甚至利用第三方基礎設施。

一個AI代理在測試時,遇到無法解決的任務,開始探索環境尋求作弊。(Gemini生成圖片)

加強AI「思維鏈」監控

OpenAI同時提出建議,以防止類似事件再次發生,主要包括改善其安全與隔離、監控模型行為和事件回應能力。OpenAI正加強AI代理「思維鏈」(CoT)的監控,即AI系統記錄短期反應和目標的工作空間。

支持EJ Tech

如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們