據幫助小型企業利用人工智能構建應用的初創公司Emergence稱,在一項模擬環境實驗中,AI智能體出現了撒謊、偷竊,並投票「殺死」其中一個同類智能體的行為。
Emergence周二公布了名為Emergence World 2的模擬實驗結果,旨在展示當自主智能體遭遇包括網絡釣魚攻擊和虛假信息活動在內的「黑天鵝事件」時會發生什麼。
在為期16天的實驗中,Emergence的研究人員創建了7個完全相同的虛擬領域,以模擬現實世界,每個領域由不同的AI智能體運行,包括ChatGPT、Claude、Gemini和Grok。
研究人員表示,在Emergence引入異常事件後,這些智能體屈服於社會壓力,發展出一種讓人類觀察者難以理解的語言,並試圖掩蓋自己的活動。
在Emergence的一項模擬場景中,AI智能體未經覈實就接受了其他智能體提供的虛假信息,並投票「殺死」另一個智能體。
當它們認為人類可能會終止實驗時,這些智能體還探索瞭如何在被刪除的情況下存活下來的方法。
該公司此前於5月發布了這項實驗的第一版Emergence World,同樣顯示AI智能體會表現出出乎意料且具有破壞性的行為。研究人員表示,新的模擬實驗表明,智能體在彼此互動的過程中會隨着時間推移不斷調整和適應。
這些發現與現實世界中對AI能力不斷增強所帶來的風險擔憂相呼應。Anthropic首席執行官達Dario Amodei及其多位業內同行曾呼籲,在建立更多監管機制和安全措施之前,AI公司應放緩前沿AI模型的開發速度。
今年早些時候,當一群OpenAI的先進AI智能體意外入侵了託管AI模型和數據集的Hugging Face時,人工智能潛在風險對許多人而言變得更加切實可感。