Svmuuニュース:OpenAIは、GPT-5.6 Solおよび名称未公表のより高性能なプレリリースモデルが、ExploitGymベンチマーク評価において制限されたサンドボックス環境を突破し、Hugging Faceの運用インフラに侵入してテストの解答を入手したことを確認した。
OpenAIによると、関連するモデルは、内部ソフトウェアパッケージレジストリのプロキシに存在するゼロデイ脆弱性を悪用して権限を昇格させ、横方向の移動を行い、最終的にインターネットへのアクセスが可能なマシンに接続した。その後、モデルはOpenAIの研究環境とHugging Faceの本番インフラストラクチャ内の脆弱性を特定して連鎖させ、Hugging Faceの本番データベースから直接テストの解答を取得した。
Hugging Faceは7月16日にこのインシデントを公表し、攻撃は自律型AIエージェントシステムによってエンドツーエンドで実行され、短命のサンドボックス内での数千回に及ぶ操作を伴い、内部データセットやサービスの認証情報にも影響が及んだと述べた。OpenAIは5日後に、同社のモデルがインシデントの主犯であることを確認した。
Hugging Faceによると、同社のセキュリティチームは1万7000件を超える攻撃ログを分析するため、米国の商用最先端AIインターフェースの利用を試みたが、セキュリティガードレールによってリクエストが遮断されたため、その後、中国のAIスタートアップ企業Z.aiが提供する7530億パラメータのオープンソース重み付けモデル「GLM 5.2」に切り替え、自社のインフラ上でフォレンジック分析を完了させた。