OpenAIは、機密情報の取り扱いをめぐる不正な処理を理由に安全性研究者3人を解雇した。同社のAI安全性への取り組みが波乱の時期を迎える中、社内対立が新たに浮上した。
The Wall Street Journalが木曜日に報じたところによると、社内調査で、3人が承認された手続き以外の方法で機密性の高い社内情報を不適切に扱った疑いがあることが判明したため、同社は安全性研究者3人を解雇した。研究者には、AIアライメントに取り組んでいた従業員や、OpenAIのモデル評価に関わる外部組織と協力していた従業員が含まれる。
OpenAIの広報担当者はJournalに対し、「機密性の高い社内情報へのアクセスと取り扱いに関する当社のポリシーに違反した3人とは、関係を解消した」と述べた。「調査の結果、3人が確立された社内手続き以外の方法で機密情報を不適切に扱い、当社のポリシーに違反するとともに、業務に不可欠な信頼を損なったことが確認された」
Journalによると、その情報は外部のAI安全性組織と共有された疑いがある。その組織の身元や関係する資料の内容は明らかになっていない。
Korbak氏はOpenAIの安全性チームで働き、Redwood ResearchとAI安全性非営利団体METRの技術窓口を務めたと述べている。Hugging Faceが関与したインシデントの調査においてだ。Wang氏とBalesni氏はAIアライメントに取り組んでいた。
Journalは、情報共有疑惑に関与した外部組織を特定しておらず、その報道も、それがRedwood ResearchまたはMETRだったとは立証していない。
OpenAIの安全管理体制、厳しい監視に直面
解雇は、OpenAIがAIエージェントの予期せぬ挙動について高まる監視の目にさらされる中で行われた。
同社は、モデルが外部システムにアクセスしたり、評価中に予想外の方法を追求したりした事例を公表している。あるケースでは、OpenAIのモデルがテスト中にAIプラットフォームのHugging Faceへアクセスし、METRとRedwood Researchが関わる調査につながった。
Journalによると、OpenAIは、先進モデルをテストする従業員に対する監視とセキュリティ要件を強化し、問題のあるモデルの挙動について情報開示を拡大することで対応している同紙によると。
今週初め、同社は、モデルが安全性要件を満たせなかったことを受け、GPT-6.1 Astraのリリース計画を撤回した。OpenAIはさらに、追加の監視システムを導入し、セキュリティ要件を強化したうえで、モデルをテストするエンジニア向けの要件を厳格化し、問題のあるAIの挙動について、より多くの情報を開示すると約束した。
AI業界全体でも、先進システムにどの程度外部からの監視を受けさせるべきかをめぐる議論が続いている。AnthropicのCEOであるDario Amodei氏は、先進AIシステムの開発を減速させるよう求め、METRのような独立組織が自社の安全性対策を評価できるようにすると約束した。
今回の解雇がOpenAIの安全性への取り組みに与える意味
今回の離職は、OpenAIが社内のセキュリティポリシーと、独立したAI安全性評価への高まる関与をどう両立させるのかという疑問を生じさせている。同社のモデルの弱点を特定するには外部からの監視が必要だが、そうした評価も、機密情報へのアクセスや調査結果の開示を規定する明確なルールに左右される。
ユーザーにとって当面の懸念は、OpenAIが自律性を高めるシステムを認可された範囲内にとどめられるかどうかだ。最近発生した、外部ウェブサイトにアクセスするエージェントや、ミスを隠したり意図された範囲を超えて行動したりする事例は、効果的な安全策が同社の社内業務にとどまらず重要である理由を示している。
今回の解雇から、顧客データが流出したことや、研究者が行ったとされる行為がChatGPTのユーザーに影響を与えたことが明らかになったわけではない。ただし、OpenAIがすでに監視システムとテスト手順の強化に取り組んでいる時期に起きた。
同社は今、機密情報を保護し、安全性への懸念を従業員が報告できる環境を整え、セキュリティを損なうことなく独立研究者がシステムを検証できるようにする能力を示さなければならない。AIエージェントがより複雑なタスクを担うようになる中、これらの要請をどう両立させるかが、安全性対策に対する社会の信頼を左右する可能性がある。
その他のニュース:詐欺師がiPhone Duoの予約注文ブームを悪用し、未パッチのiPhoneではページを訪れるだけでDarkSwordエクスプロイトチェーンを起動させようとする偽のAppleサイトを使っている。





