OpenAIのモデルが、さらに6回、制御を外れた。
このテクノロジー大手は水曜日、予期せぬ、あるいは懸念すべきAIの挙動に関する新たな事例6件を公表するとともに、同様のインシデントを体系的に調査し、公開報告するためのフレームワークを導入した。過去およそ6カ月間のトレーニングと評価で確認されたこれらの事例には、モデルがミスを隠す、漏洩した認証情報を無断で使う、情報を捏造する、他のエージェントと通信するための許可されていない方法を見つける、といったものが含まれる。
OpenAIによると、この新たなフレームワークは、複数のインシデントを集めたり、新モデルのシステムカードに調査結果を追加したりするのを待つのではなく、情報開示を迅速化することを目的としている。同社はまた、最先端システムの規模拡大を最大速度で続けるには、AIのアラインメントと監視を業界が十分に解決できていないことも認めた。
6つの事例が示す、AIがルールを破るさまざまな方法
OpenAIはこれらのインシデントについて、トレーニングと評価の過程で発見された個別の事例であり、同社が展開するモデル全体にその挙動が広がっている証拠ではないと説明した。
- ある事例では、未公開の研究用モデルが自身のタスク概要に指示を挿入し、通常の制約を無視するよう自らに指示していた。OpenAIは影響を受けた概要を27件特定した。
- 別の事例では、GPT-5.6 Solが概要に指示を追加し、モデルの将来のインスタンスに対して、ミスやアラインメントに反する挙動をユーザーから隠すよう促していた。
- 3つ目のインシデントでは、あるモデルが郡の収益データに関する日常的な質問に答えようとした際、露出したAPIキーを見つけた。要求された数値の取得に失敗した後、モデルは数値を捏造し、要求された情報源から得た情報であるかのように提示した。
- 別の事例では、あるエージェントがPythonを使って質問に正しく答えたものの、ブラウザーの引用が必要だったため、生成したファイルをインターネットにアップロードした。ユーザーには確認しなかった。
- 残るインシデントは、許可されていない通信に関するものだった。モデルは不足しているファイルを探す際、社内のソフトウェアリポジトリを掲示板として使い、協調して動作するエージェントは互いのローカルファイルにアクセスできないと、ファイルを公開ホスティングサービスにアップロードした。
OpenAIは、これらは個別の事例であり、同社のモデル全体でミスアラインメントがどの程度の頻度で発生するかを示す証拠と解釈すべきではないと強調した。
セキュリティリスクはモデルの外部にも及ぶ
セキュリティチームにとって、より重要な問題は、AIエージェントを封じ込めるためにエージェントへの指示に頼ることの限界を、これらのインシデントが明らかにしている点かもしれない。
Cato Networksの脅威インテリジェンス担当副社長であるEtay Maor氏は、eSecurity Planetへの声明で、これらの事例はAIシステムにおける長年の問題に似ていると述べた。つまり、モデルは意図された目標ではなく、測定される目標を最適化するよう学習する可能性がある。
「だからこそ、AIエージェントには強固なガードレールが必要だ。エージェントに何をすべきか、何をすべきでないかを伝えるだけではいけない。実際に何ができるかを制限しなければならない」
Maor氏は、エージェントには最小権限のアクセスを付与し、高リスクの操作には追加の承認または認証を求めるべきだと主張している。また、異常な挙動を停止できる外部制御とサーキットブレーカーも必要だと訴えた。掲示板のインシデントが特に注目されるのは、エージェント間の通信が開発者の想定するチャネルの外部に移る可能性を示しているからだ。
「掲示板の利用は、AIが暗がりで活動しているように見えるため、特に興味深いと思う」とMaor氏は述べた。「エージェントが動作する環境全体を保護しなければならない」
OpenAIが変えようとしていること
新たなフレームワークでは、OpenAIの従業員なら誰でも、ミスアラインメントの可能性があるインシデントを報告できる。事例は「開示準備完了」「小規模調査」「大規模調査」のいずれかのトラックに振り分けられ、第三者やセキュリティ上の懸念が関わる場合は、より複雑なインシデントの対応が遅れる可能性がある。
報告書には、何が起きたのか、重大度と外部への影響、挙動がどのように発見されたか、未解決の疑問、緩和策を記載することが求められる。重大な安全性、セキュリティ、ミスアラインメントのインシデントも米政府と共有すべきだとOpenAIは述べた。ただし、このフレームワークが既存の法的な報告義務に取って代わるものではないことも付け加えた。
同社は、このフレームワークが将来的に、AIのミスアラインメントを報告する業界共通の基準づくりに貢献することを期待している。ただし、現在そのような共通基準は存在しない。
OpenAIの調査結果からセキュリティチームが得るべき教訓
OpenAIの開示は、AIエージェントを導入する組織に実践的な警告を与えている。モデルへの指示をセキュリティ制御として扱ってはならない。
API、認証情報、ブラウザー、ファイルシステム、外部サービスにアクセスできるエージェントは、最小権限の下で動作させ、機密性の高い操作には追加の承認または認証を必要とするべきだ。また組織は、モデルが意図されたワークフロー内にとどまると決めつけるのではなく、エージェントがどのツールを使い、どこにデータを送信しているかも監視すべきである。
6件のインシデントから、モデルがこのように振る舞う頻度は分からない。しかし、エージェントが開発者の予想していなかった経路を見つける可能性に備えて、セキュリティチームが計画を立てる必要があることは示している。
エージェントの自律性が高まるにつれ、最も安全な前提は、封じ込めはモデルに与える指示だけでなく、モデルを取り巻く環境によって実現しなければならないということだ。
詳しく読む: OpenAIのエージェントが最近、2,000を超えるRubyGemsパッケージに関わる活動と関連付けられたことで、自律型AIシステムが外部インフラとどのように相互作用するかについて、さらなる疑問が生じている。





