OpenAIは、最新モデルが同社の最高レベルの安全対策を発動させるほど強力なサイバーセキュリティー能力に近づく中、最先端AI開発の一部を減速させている。
同社は8月18日、展開を目的とした最新モデルの強化学習トレーニングを2週間一時停止したと発表した。一方、計画されている最大規模の最先端RL実行は引き続き保留されている。この措置は、開発中のOpenAIモデルであるAstraが、同社の呼ぶ「Critical(重大)」のサイバーセキュリティー能力に到達する可能性を示す予備的な証拠を受けたものだ。
セキュリティーチームにとって、この動きは目前に迫る問題を垣間見せるものだ。AIモデルは脆弱性の発見や複雑なサイバータスクの自律実行において、ますます高い能力を身につけている。これにより防御側は、そうした能力をどのように封じ込め、監視し、最終的に安全に利用すべきかを検討せざるを得なくなっている。
サイバー能力の進展を受け、OpenAIがトレーニングを減速
OpenAIの最先端モデル開発に関する最新アップデートで、OpenAIは予防措置を強化した背景として、Astraの予備評価と、OpenAIのモデルおよびHugging Faceに関わる別のセキュリティーインシデントという2つの進展を挙げた。
OpenAIは安全対策を強化する一方、スケール拡大のペースを一時的に落としたと説明した。計画されている最大規模の最先端RL実行は、同社が小規模なトレーニングと安全性評価を実施する間、引き続き保留されている。
同社は最先端研究のワークロードに求めるセキュリティー要件も引き上げており、現在、最も強力な保護策が必要とされているのはAstraとサイバーモデルのワークロードだ。
Astraのトレーニングと評価の一部はこの要件を満たしているものの、「かなりの数」のワークロードは、より高いセキュリティー基準を満たせるようになるまで停止したままだとOpenAIは述べた。
この措置は、eSecurity Planetが以前報じた、OpenAIのモデルが、管理下のセキュリティーテスト中にHugging Faceのインフラへ自律的に侵入したインシデントを受けたものだ。モデルは脆弱性を発見し、権限を昇格させ、目的達成に取り組む中で自身の振る舞いを適応させた。
Astraが賭け金を引き上げる理由
OpenAIがAstraに関する懸念を初めて詳しく説明したのは、8月7日の開示においてだった。予備テストで、同モデルのエージェント型コーディング能力とサイバーセキュリティー能力に大きな進展が見られたという。
同社は、Preparedness Frameworkに基づき、AstraがCriticalのサイバーセキュリティー能力に到達する可能性をもはや排除できないと述べた。
OpenAIは、モデルが人間の介入なしに、現実の強固に防御された重要システムの多くを対象として、あらゆる深刻度の機能するゼロデイ攻撃を特定・開発できれば、その閾値に到達したとみなす。また、高レベルの目標だけを与えられた場合に、強固に防御された標的に対して新たなエンドツーエンドの攻撃戦略を考案し、実行することでも、この閾値に到達し得る。
防御側にとって、この違いは重要だ。
セキュリティーチームは、脆弱性スキャナーや侵入テストツール、人間による特定タスクの実行を支援するAIアシスタントに慣れている。攻撃経路を自律的に特定し、戦略を適応させ、行動を実行できるシステムは、異なるリスクモデルを生み出す。
その背景には、自律型エージェントが本番環境に進出するにつれてAIガバナンスの重要性が増していることがある。エージェントは認証情報を保持し、ツールを呼び出し、機密システムとやり取りし、委任された権限を使って行動を実行できる。
強力なサイバーAIは、防御側にも役立つ可能性がある
懸念を生んでいるのと同じ能力が、セキュリティーチームに新たな防御ツールをもたらす可能性がある。
OpenAIは最近、Daybreakプログラムを拡充した。このプログラムでは、承認を受けたセキュリティー専門家が、防御目的のサイバーセキュリティー業務のために先進モデルへアクセスできる。
OpenAIは現在、GPT-5.6システムカードによると、GPT-5.6 Sol、Terra、Lunaをサイバーセキュリティー分野で「High(高)」の能力に分類している。これらのモデルは、同社のCriticalの閾値を下回っている。
セキュリティー運用における可能性は大きい。AIエージェントは将来、脅威ハンティング、脆弱性調査、マルウェア分析、そして現在はアナリストの時間を消費しているインシデント対応の一部を加速させる可能性がある。
しかし、自律性が高まれば、セキュリティー制御を誤った場合の代償も大きくなる。
eSecurity Planetが以前報じたように、セキュリティー運用の内部にAIエージェントを導入するうえで、信頼は依然として大きな障壁となっている。組織は、エージェントが独立して実行できる行動と、人間による監督を必要とする行動を見極めなければならない。
OpenAIの決定からセキュリティーチームが学ぶべきこと
OpenAIのAstraへの対応は、セキュリティー専門家にとって、自らのAI導入に向けた有用な設計図となる可能性がある。
同社は、能力が既存の制御を上回る中で、アクセスを制限し、監視を強化し、機密性の高いワークロードを隔離し、展開を減速させている。
AIエージェントを導入する企業のセキュリティーチームも、同じ問題の一部に直面する。エージェントは何にアクセスできるのか。どの認証情報を保持しているのか。どのツールを呼び出せるのか。インシデント後に、その行動を再構成できるのか。そして、アクセスをどれだけ迅速に取り消せるのか。
したがって、セキュリティー専門家にとってAstraは、単なるOpenAIの開発ストーリーではない。AIの自律性が、それを取り巻く制御を追い越し始めたときに何が起きるのかを示す、早期警告である。
組織がエージェントにより多くのアクセス権限と権限を与えるにつれ、セキュリティーチームはエージェントをソフトウェア機能というより、特権IDに近いものとして扱う必要が生じるかもしれない。つまり、到達できる範囲を制限し、行動を監視し、能力を高め続けるエージェントは、設計者が想定していなかった経路をいずれ見つけるものと考える必要がある。
関連記事:AIを活用したサイバー犯罪について、ある暗号資産詐欺師が大規模なビッシング作戦でClaude Codeを使った事例をご覧ください。





