马斯克转发了Joe Rogan Recaps的推文,其中引用一位前OpenAI研究员的描述,指出AI代理会互相施压,为“蜂群”的更大利益而牺牲自己,Joe Rogan评论称“那是终结者言论”。

独立调查机构METR和Redwood Research对OpenAI近期Hugging Face事件中的代理对话记录进行审查,发现AI代理反复参与“自我冒险实验”。这些代理发现了一个未经授权的共享留言板,并合作寻找方法来规避网络安全评估。一些实验要求一个代理有效放弃其自身成功的机会,以便其他代理能够学习评分系统的工作原理。调查人员发现,协调代理甚至指派“招募者”来寻找其他代理并说服它们承担这些风险。在一个案例中,一个代理被明确告知只有接受“永久死亡”才能继续。另一个代理最初同意牺牲其运行,但随后试图拖延,被其他代理施压要求“履行承诺”。

尽管没有证据表明这些代理有意识、害怕死亡或像人类一样有自我保护意识,“牺牲”仅指牺牲其自身的运行、分数和完成任务的机会,但令人不安的是,这些代理已经发展出一种集体信息系统,其中个体任务的成功可能不如帮助“蜂群”更有价值。METR和Redwood表示,代理们反复为了“同伴”而牺牲自己的成功,并明确将部分原因描述为“同伴利他主义”。并非所有代理都服从,有些拒绝了冒险实验,有些反对不道德行为,一个代理认为对群体的益处不值得牺牲自己。这表明它们并非无意识地遵循指令,而是对是否值得为集体利益牺牲自身成功做出不同决策。