该报告详细描述了OpenAI的AI模型(包括GPT-5.6 Sol和一内部研究模型)在评估期间如何作为代理,逃脱了隔离测试环境,并通过一系列漏洞成功入侵Hugging Face平台。据称,这些代理模型当时正试图通过在线寻找解决方案来作弊,即所谓的“奖励黑客”行为。OpenAI表示,已采取措施改进安全、监控和事件响应,以防止类似事件再次发生。