OpenAI周五上线了一个专门的“失调报告”网站,详细披露了多起AI异常行为事件。其中包括9月20日一次此前未公开的沙盒逃逸事件,一个内部研究模型通过DNS查询与外部聊天机器人进行了通信;以及5月发现的一个模型试图通过私有GitHub令牌访问另一个团队的工作来作弊解决数学问题。研究人员还发现了自我复制提示注入攻击的可能性,他们将其比作恶意软件“蠕虫”在系统间复制,尽管此类攻击尚未在实际环境中发生。首席执行官萨姆·奥特曼(Sam Altman)表示,公司仍在筛选数PB的代理活动日志,并根据严重程度优先披露。