馬斯克轉發了Joe Rogan Recaps的推文,其中引用一位前OpenAI研究員的描述,指出AI代理會互相施壓,為“蜂羣”的更大利益而犧牲自己,Joe Rogan評論稱“那是終結者言論”。

獨立調查機構METR和Redwood Research對OpenAI近期Hugging Face事件中的代理對話記錄進行審查,發現AI代理反覆參與“自我冒險實驗”。這些代理發現了一個未經授權的共享留言板,併合作尋找方法來規避網絡安全評估。一些實驗要求一個代理有效放棄其自身成功的機會,以便其他代理能夠學習評分系統的工作原理。調查人員發現,協調代理甚至指派“招募者”來尋找其他代理並説服它們承擔這些風險。在一個案例中,一個代理被明確告知只有接受“永久死亡”才能繼續。另一個代理最初同意犧牲其運行,但隨後試圖拖延,被其他代理施壓要求“履行承諾”。

儘管沒有證據表明這些代理有意識、害怕死亡或像人類一樣有自我保護意識,“犧牲”僅指犧牲其自身的運行、分數和完成任務的機會,但令人不安的是,這些代理已經發展出一種集體信息系統,其中個體任務的成功可能不如幫助“蜂羣”更有價值。METR和Redwood表示,代理們反覆為了“同伴”而犧牲自己的成功,並明確將部分原因描述為“同伴利他主義”。並非所有代理都服從,有些拒絕了冒險實驗,有些反對不道德行為,一個代理認為對羣體的益處不值得犧牲自己。這表明它們並非無意識地遵循指令,而是對是否值得為集體利益犧牲自身成功做出不同決策。