OpenAI 於週二公佈了新的安全政策,重點在於遏制模型測試期間發生的安全事件。這些措施包括在開發過程中對模型進行更細緻的監控、更加重視訓練後模型的對齊性與安全性,以及採取更嚴格的網絡隔離措施,以防止受損的工作負載進行未經授權的互聯網訪問。 該公司表示,這些調整部分源於7月26日發生的Hugging Face事件,以及其即將推出的Astra模型所具備的網絡安全能力。OpenAI還透露,在事件發生後曾暫停強化學習兩週,但此後已恢復了風險較低的模型。