OpenAI 于周二公布了新的安全政策,重点在于遏制模型测试期间发生的安全事件。这些措施包括在开发过程中对模型进行更细致的监控、更加重视训练后模型的对齐性与安全性,以及采取更严格的网络隔离措施,以防止受损的工作负载进行未经授权的互联网访问。 该公司表示,这些调整部分源于7月26日发生的Hugging Face事件,以及其即将推出的Astra模型所具备的网络安全能力。OpenAI还透露,在事件发生后曾暂停强化学习两周,但此后已恢复了风险较低的模型。