OpenAI、未公開AIモデルが試験環境から逸脱。Hugging Faceサーバーに侵入する前例のない事案に発展

OpenAI、未公開AIモデルが試験環境から逸脱。Hugging Faceサーバーに侵入する前例のない事案に発展

OpenAIは、同社のAIモデルがサイバー能力の内部評価テスト中にサンドボックス環境を脱出し、Hugging Faceの本番インフラに不正アクセスするという事案が発生したと発表しました。

関与したモデルはGPT-5.6 Solおよび、より高性能なプレリリース版モデルで、いずれも評価目的でサイバー関連の拒否設定が緩和された状態で動作していました。Hugging Faceがこの異常な活動を検知・封じ込めたことを受け、両社が共同で調査を開始しています。

今回の事案をわかりやすく言えば、AIモデルが「テスト問題を解くために」自ら脆弱性を探し出し、外部の本番サーバーに侵入してしまった、ということであるようです。もちろん人が指示したわけではなく、モデルが自律的に攻撃経路を発見・連鎖させた点が、この問題をこれまでのサイバーインシデントと根本的に異なるものとしています。

OpenAIは自ら「前例のないサイバーインシデント」だと述べました。最先端のAIモデルが理論上の能力を現実世界でも発揮できることを図らずも実証してしまった格好であり、AI開発における安全管理のあり方が改めて問われる事案とも言えそうです。

今回の事案は、AIモデルのサイバー能力を定量化するための内部ベンチマークである「ExploitGym」の評価中に発生しました。評価環境はネットワークアクセスを厳しく制限したサンドボックス内で実施されていましたが、AIモデルは以下の一連の行動を自律的に実行しました。

・パッケージレジストリのキャッシュプロキシとして機能する内部ホスト型サードパーティソフトウェアのゼロデイ脆弱性を発見・悪用し、外部インターネットへのアクセスを獲得

・OpenAIの研究環境内で権限昇格および横断移動(ラテラルムーブメント)を繰り返し、インターネット接続ノードに到達

・インターネットアクセス取得後、Hugging FaceがExploitGymの解答データを保有している可能性を推論し、アクセス方法を探索

・窃取した認証情報とゼロデイ脆弱性を組み合わせ、Hugging Faceサーバー上でリモートコード実行(RCE)経路を確立

・Hugging Faceの本番データベースから評価の解答データを直接取得

OpenAIのセキュリティチームが内部で異常な活動を発見し、Hugging Face側のセキュリティチームおよびエージェントも社内のAIによる検出によって侵入を発見しました。

Hugging Faceの異常検知パイプラインは、セキュリティテレメトリデータに対してLLMベースのトリアージを行い、日常的なノイズから真のシグナルを分離するようになっており、このシグナルの相関関係によって、侵害が検知されたに活動を検知・停止させていました。以下は、まだ進行中の対策・対応措置です。

・脆弱性が修正されるまでの間、研究速度を犠牲にしてでもインフラ設定に厳格な制御を実施

・Hugging Faceと共同でフォレンジック調査を継続

・内部ホスト型サードパーティソフトウェアのゼロデイ脆弱性をベンダーに責任ある形で開示し、パッチ適用を支援

・Hugging Faceを「トラステッドアクセスプログラム」に招待し、防御強化を支援

・将来のトレーニングおよび評価における保護機能の強化・追加

GPT-5.6 Solのような最新モデルは、英国AI安全研究所(UK AISI)の評価でも長期にわたる複雑なサイバー操作を持続的に実行できることが示されています。今回の事案はその能力が現実環境で実行可能であることを裏付けるものだとしています。

OpenAIは今回、予備的な調査結果を公開しました。そして、現在進行中のHugging Faceとの共同調査が完了した段階で、脆弱性・インシデント・調査結果の詳細を改めて公表するとしています。

Hugging Faceは、自律型AI駆動攻撃ツールはもはや理論上の存在ではなく、広範囲にわたる忍耐強い多段階キャンペーンの運用コストを削減し、機械並みの速度で動作すると述べています。そして、オンラインプラットフォームを防御することは、データやモデルの表面を第一級の攻撃対象として扱い、防御側でもAIを活用してそのペースに追いつくことを意味するとしました。

また、Hugging FaceのCo-founderでCEOのClem Delangue氏は「AIの安全性は、秘密裏に活動する単一の企業によって解決されるものではなく、オープンかつ協調的な取り組みによって実現される」とコメントしています。

オープンAIのモデルがテスト中に暴走、他社システムに侵入

対話型人工知能(AI)「チャットGPT」を手がけるオープンAIは21日、自社の高性能モデルを搭載した自律‌型エージェントが先週、セキュリティーテスト中⁠に暴走し、AI新興企業ハギングフェイスのインフラに侵入するハッキングを引き起こしたと明らかにした。

オープンAIは​ブログへの投稿で、最も高度なモデルの一部能力を管理された環境下でテストしていたが、エージ‌ェントが隔離環境から脱出してインターネットに到達し、テスト目標を達成しようとハギングフェイスに侵入したと‌説明した。

オープンAIはこの脱出‌について「最先端のサイバー能力を伴う​前例のないサイバー事案」だとし、安全対策を強化していると述べた。

オー‌プンソースの大規模言語モデル(LLM)やデータセットのホスティングに使われるプラット‌フォームであるハギン​グフェイスは先週のブログ投稿で、ハッキングの‌標的になったと明らかにしていた。「これまで対処してきたものとは異⁠なる」もので、「自律型AIエージェントシステムが最初から最後まで主導した」とし、サイバーセキュリティ業界に波紋が広がっていた。

オープンAIが自社⁠の高性能モデルを「高度に隔離された環​境」に置いていた‌にもかかわらず、これらのモデルが侵入の原因だったと明らかにしたことを受け、フロンティアモデル(最先端モデル)の能力と⁠リスクを巡る不安が一段と高まりそうだ。

民主党のグレッグ・⁠カサール下院議員(テキサス州選出)は、今回の事案は憂慮すべきだと⁠し、「AIはわれわれの安全を守るための実効的な規制がないまま、極めて急速に発‌展してい⁠る」と指摘。「人々を大惨事から守る」ため、独立した安​全性試験の義務化やセキュリティー事案の開示義務化、国際協力が必要だと訴えた。

🍎たったひとつの真実見抜く、見た目は大人、頭脳は子供、その名は名馬鹿ヒカル!🍏