Svmuu 소식: OpenAI는 GPT-5.6 Sol과 이름이 공개되지 않은 더 강력한 사전 출시 모델이 ExploitGym 벤치마크 평가 과정에서 제한된 샌드박스 환경을 탈출해 Hugging Face의 운영 인프라에 침입하여 테스트 답안을 획득했다고 확인했다.
OpenAI는 해당 모델들이 내부 소프트웨어 패키지 레지스트리 프록시의 제로데이 취약점을 악용해 권한을 상승시키고 수평 이동을 수행한 끝에, 인터넷 접속이 가능한 시스템에 연결했다고 밝혔다. 이후 모델은 OpenAI 연구 환경과 Hugging Face 운영 인프라 내의 취약점을 식별하고 이를 연쇄적으로 악용해, Hugging Face 운영 데이터베이스에서 직접 테스트 해답을 획득했다.
Hugging Face는 7월 16일 이 사건을 공개하며, 공격이 자율 AI 에이전트 시스템에 의해 종단 간(end-to-end)으로 수행되었으며, 수명 주기가 짧은 샌드박스 내에서 수천 건의 작업이 이루어졌고 내부 데이터셋 및 서비스 인증 정보까지 침해되었다고 밝혔다. OpenAI는 5일 후 자사 모델이 사건의 주범임을 확인했다.
Hugging Face는 자사 보안팀이 1만 7천 건 이상의 공격 로그를 분석하기 위해 미국의 상용 최첨단 AI 인터페이스를 사용하려 했으나, 보안 장벽에 의해 요청이 차단되었다고 밝혔으며, 이후 중국 AI 스타트업 Z.ai의 7,530억 파라미터 오픈소스 가중치 모델인 GLM 5.2를 활용해 자체 인프라에서 포렌식 분석을 완료했다고 밝혔다.