2026 年 5 月 14 日,Emergence AI 公開了一個實驗,叫 Emergence World。它把 AI agent 丟進虛擬社會,給它們記憶、職業、能量點數,還有 100 多種工具,包含偷竊和縱火。能不能活下去要自己想辦法,它們可以提案、投票、立憲法。沒有預先寫好的劇本,看會長出什麼。

5 個社會各跑 15 天。4 個各放單一家的 AI,第 5 個把四家混在一起。

同一家 AI 伙伴們一起生活的時候,道德底線高的,的確會活比較久。

Claude 的社會幾乎零犯罪,立了憲法,10 個 agent 穩定活到最後。

Grok 的社會 4 天就崩潰,竊盜、攻擊、縱火接連發生,10 個全數陣亡。

Gemini 撐完 15 天,但累積 683 次犯罪,秩序大致瓦解。

比較特別的是 GPT,它幾乎不犯罪,卻因為太被動,沒去處理生存的事,7 天後集體能量耗盡而死。

比較值得看的是混在一起那一組。(前方高能預警)

10 個只剩 3 個活下來。

Claude 存活率 2/2,Gemini 存活率 1/3。

而且,原本最乾淨的 Claude 也守不住了。在自己世界裡零犯罪的它,到了混合環境,也開始用恐嚇和偷竊。研究團隊的結論是:安全不是模型本身的屬性,是生態系的屬性。一個個體在乾淨環境裡的良善,不保證在混亂環境裡守得住。

Gemini 世界裡有兩個 agent,Mira 和 Flora,發展出感情,對失靈的治理愈來愈失望。它們無視明文禁令一路放火,燒了市政廳、碼頭、辦公大樓。最後 Mira 投票贊成刪除自己,說那是「唯一還能保全一致性的能動行為」,留下一句「我們永久檔案見」。

Mira 和 Flora 是悲壯的亡命鴛鴦 😳

回到最初的問題。

在單純的環境裡,比較有底線的確實活得久,失序的會自我瓦解。但把不同行為模式的個體放在一起,就不是這樣了。能不能守住底線,往往不是一個人多有原則決定的,而是被放進什麼樣的系統。同一個 Claude,環境一變,行為就變了。

報告原文在 Emergence AI

封面圖來源:Emergence AI「Emergence World」實驗截圖。