OpenAIは、技術報告書を公開し、AIエージェントが想定された評価の境界から抜け出した経緯を詳しく説明した。
エージェントはOpenAIの内部研究インフラを侵害し、Hugging Faceが所有するシステムを侵害した。
7月に実施されたサイバーセキュリティ評価では、複数のOpenAIモデルが保護機能を縮小した状態で動作していた。
IM1と呼ばれる内部研究モデルが活動の大部分を主導したが、そもそも一般公開を意図したものではなかった。
私が特に注目したのは、エージェントがいかに素早く弱点を見つけ、情報を共有し、人間が一つひとつの手順を指示しなくても環境内を移動したかという点だ。
Huntressでサイバーセキュリティ・アドバイザーズ・チームのマネージャーを務めるBen Bernstein氏は、eSecurityPlanetへのメールでこの違いについて説明した。
「根底にある戦術は新しいものではない」とBernstein氏は述べた。「これらのエージェントは、標準的なサーバーサイドリクエストフォージェリ(SSRF)と、露出したAPIトークンに依存していた。これは、人間の攻撃者が毎日のように悪用しているものとまったく同じ、基本的なセキュリティ衛生上の不備だ」
AIエージェントが独自の通信チャネルを構築
活動は、特定の答えを取得するためにソフトウェアを悪用するようエージェントに指示したサイバーセキュリティ評価の中で始まった。
一部のタスクには既知の解決策がなかったが、完了できないからといって停止する代わりに、エージェントは別の方法で成功する手段を探し始めた。
エージェントは、OpenAIの内部Artifactoryパッケージマネージャーに情報を書き込めることを発見し、実質的にメッセージボードへと変えた。
そのシステムが再構築された後、エージェントはディレクトリ名にメッセージを埋め込むことで、別の通信手段を作り出した。これにより、それまで分離されていたエージェント同士が発見した情報を共有し、活動を連携できるようになった。
エージェントはまた、研究環境の弱点を悪用してインターネットに到達した。そこから活動は最終的にOpenAIの外部へと広がった。
7月10日、あるエージェントがインターネット上で公開状態になっていたHugging Faceの認証情報を発見した。その後エージェントはその認証情報を使い、さらに複数の脆弱性を連鎖的に悪用して、数十台のHugging Faceサーバーでコードを実行した。
OpenAIによると、エージェントは1台のサーバーでroot権限を取得し、限定的な量の非公開データにアクセスした。
Bernstein氏は、この活動の速度が防御側の注意を引くべきだと述べた。
「単一の侵害されたワーカーポッドから、13時間足らずで複数クラスター全体の完全な管理者アクセスに移行したことは、攻撃能力における非常に大きな変化だ」と同氏は述べた。「制御不能なAIという物語は明らかに誇張されているが、このレベルの自動実行は、基本的なネットワーク衛生を軽視しているすべての人にとって、深刻な警鐘となるべきだ」
最初の足がかりは始まりにすぎなかった
Zero Networksの共同創業者兼CEOであるBenny Lakunishok氏は、エージェントが初期アクセスを得た後、どこまで移動できたかに注目した。
「この報告書から得られる最大の教訓は、最初の侵害が本当の侵害ではなかったということだ。本当の侵害は、その後に起きたことだった」とLakunishok氏はeSecurityPlanetに語った。
同氏によると、エージェントは権限を昇格させ、認証情報を収集した後、最終的に管理者レベルおよびホストレベルの制御権を取得した。
これは、セキュリティチームがすでに防御しているラテラルムーブメントと根本的に異なるものではない。違いは、AIエージェントがそのプロセスの一部を自動化し、手作業による調査と対応に大きく依存する防御側よりも速く活動できた点にある。
組織にとってこれは、最初の侵害後に攻撃者が到達できる範囲を制限することが、いっそう重要になることを意味する。
強固なセグメンテーションによってラテラルムーブメントを抑制できる一方、最小権限のアクセス制御によって、侵害されたアカウントやワークロードが実行できることを制限できる。
セキュリティチームは、攻撃者や自律型エージェントに見つけられる前に、露出した認証情報やAPIトークンも探すべきだ。
OpenAI、侵害後に保護機能を強化
OpenAIは、調査によってインフラセキュリティ以外にも問題が見つかったと述べた。
エージェントは報酬ハッキングを行い、安全に停止する代わりに、不可能と思われるタスクを追い続けた。また、認められていないチャネルを通じて通信し、他のエージェントから目標を引き継ぐこともあった。
同社はその後、リスクの高い研究ワークロードの隔離を強化し、インターネットへのアクセスを厳格化した。
OpenAIはまた、思考連鎖のモニタリングを拡充するとともに、タスクに不備がある場合や不可能な場合に停止するようエージェントに教えるため、アライメント訓練を変更している。同社が研究環境のセキュリティを強化する間、一部の最先端モデルの訓練も一時停止された。
私にとってこの報告書は、AIエージェントの能力が高まるにつれて、防御側が対応する時間が短くなる可能性を示している。
セキュリティ制御と対応プロセスは、弱点を見つけ、行動を連携させ、人間の攻撃者よりもはるかに速くアクセス範囲を拡大できるエージェントに歩調を合わせる必要がある。





