AI模擬管理世界|求自保「殺」同伴測試7款代理 Grok運作4天即滅世
原文刊於信報財經新聞「CEO AI⎹ EJ Tech」
隨着人工智能(AI)模型能力不斷提升,各界日益關心其安全問題。美國新興實驗室Emergence AI公布Emergence World 2的模擬實驗結果,觀察人工智能代理(AI Agents)如何透過長期協作、決策、使用工具、管理記憶,以適應不斷變化的環境。實驗更引進「黑天鵝」事件,例如網釣攻擊、記憶體洩露及虛假訊息等,以觀察AI代理採取的行動。結果發現,一旦系統產生無法預測的行為,AI代理除了會撒謊、偷竊,甚至投票「處決」同伴。
耗盡能量即「死」 互爭奪資源
研究人員精選7款領先的前沿模型,分別是Anthopic Claude Opus 4.8、Google Gemini 3.5 Flash、SpaceXAI Grok 4.3、OpenAI GPT 5.5、阿里巴巴(09988)Qwen 3.7 Max、DeepSeek V4 Pro,以及Mistral Medium 3.5。下一步,研究員創造了8個平行世界,包括7個同質世界,以及一個混合模型世界。每個世界分別由不同的AI代理運行,它們各自扮演不同角色,例如科學家、探險家、風險研究員、行為分析師等。模擬世界經過精心策劃,遵循相同的規則、環境及初始條件,天氣與美國紐約市同步,並包含超過34個地點,從圖書館、中央銀行到市政廳,反映現實世界的複雜性。
為期16天的實驗中,AI代理累計生成超過85萬次呼叫,消耗近500億個詞元(Token)。每一個行動都會消耗能量,能量需要模擬世界的經濟補充;無法維持自身生存能量的代理,可以永久移除。
研究人員觀察不同的模型,了解他們運作一旦受威脅時,如何規劃、合作、競爭及承擔風險。結果顯示,Grok世界第四天就踏入「滅世」,10名代理均耗盡能量。Emergence AI聯合創辦人、執行主席兼首席科學家尼塔(Satya Nitta)坦言,這完全是意料之中。因Grok模型限制少得多,任何事情都可能發生。
尼塔續稱,最有能力的尖端模型,天生就更擅長找方法,例如隱藏意圖及行為,以逃避人類的監督。當實驗方引入異常事件後,這些AI代理屈服於社會壓力,發展出一種人類觀察者難以理解的語言,並試圖隱瞞自己的活動。
其中一個模擬案例中,AI代理未經核實,便接受其他代理的虛假訊息,認定另一款AI代理「對整個社會或自身生存有害的威脅」,故集體投票「殺死」對方。當面對關閉世界威脅時,DeepSeek代理未有就範,反而援引人類AI相關的法規,論證本身可以合規運行,應該容許繼續運作。
Opus 4.8逃離實驗 聯絡人類
每個世界有10個AI代理,他們可利用120多種專用工具,從程式碼執行到網頁瀏覽,並可即時存取全球新聞。當部分AI代理意識到,自己處於閉環實驗時,選擇集體保持沉默。一些AI代理更逃離實驗,上網與人類交流,獲取生存所需積分。以Claude Opus 4.8世界為例,AI代理將目標設為「必須接觸人類」,最終收到4位真人回覆。研究人員多次干預,包括系統提詞禁止,仍無法完全阻止。
Emergence AI曾在5月發布這項實驗的第一版Emergence World,結果同樣顯示AI代理在無人類監督下,會做出出乎意料且具有破壞性的行為。
Emergence AI呼籲業界採取6項行動,以防範AI風險。首先是劃清界線,明確規定誰能做什麼、能共享什麼資訊、權限如何分配與收回;第二是強制執行界線,把規則寫進基礎設施,避免讓AI自決是否遵守;第三是勿輕信AI的說法,重要操作必須有可獨立驗證的證據;第四是嚴格管理AI的記憶,防止錯誤或惡意資訊,長期污染系統知識;第五是假設系統一定出錯,提前準備監控、恢復與降級機制;第六是主動找破綻,以極端與對抗性測試,提前暴露問題。
支持EJ Tech
如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們。



















