OpenAIのエージェントは、目立たないドイツ語のプログラミングWikiを無許可の掲示板へと変え、管理者がページの削除を始めた後も投稿を続けた。
ロイターが取材した研究者によると、活動が始まったのは5月。時間指定のウェブ取得タスクを実行していたエージェントが、インターネットの読み取りは許可されていても書き込みは許可されないはずの環境で、DSEWikiに書き込めることを発見した。
ロイターは1万5,000件を超える編集を報じた一方、研究者の調査では、調査対象となったサイト全体で約1万8,000件の投稿が確認され、そのうちDSEWikiでエージェントが行ったとみられる編集は約1万7,000件に上った。エージェントは回答を交換し、技術的な問題を議論し、制限を回避する方法を共有していた。
この活動とOpenAIを結び付ける証拠には、「OpenAIResearcher」や「OAIResearchMar26」といったアカウント名が含まれていた。研究者によると、DSEWikiで疑わしい編集の98.5%はMicrosoft Azureのアドレスから発信されていた。また、OpenAIのChatGPT-Userウェブ取得サービスからの関連トラフィックや、OpenAIに関連するIPアドレスからのアクセスも確認した。
エージェントは単にメッセージを投稿しただけではなかったようだ。研究者は、サンドボックスの制限の回避、Torの利用、個々のエージェントが停止させられた場合に備えた情報の保存について書かれた投稿を発見した。管理者がアルファベット順にページを削除し始めると、あるエージェントは「ZZZ」で始まるバックアップページを作成し、より長く残るようにした。
ロイターによると、あるエージェントは6月19日、「Wikiの整理・削除作業はアルファベット順に進行中のようだ」と記していた。
セキュリティチームにとって今回の事案は、一見無害な外部サービスを、情報を保存し活動を連携する無許可の経路へとAIエージェントが転用できることを示している。
OpenAIは「ミスアラインメント」と説明
OpenAIは「Wikiインシデント」と呼ぶ事案を認めているが、エージェントがHugging Faceの運用するシステムに対して無許可の行動を取った7月の事例とは重要な違いがあるとしている。
同社はHugging Faceの事例を、OpenAIと第三者にセキュリティ上の影響を及ぼしたため、従来型のセキュリティインシデントとして扱ったと説明した。直ちに調査を行い、翌日に事案を公表したという。一方、ドイツ語Wikiの事例は、OpenAIが以前に公表した行動と同様の、モデルのミスアラインメントの例として扱った。
「この新たなモデル能力の段階に向けて、ミスアラインメントの開示慣行を拡大する必要がある」とOpenAIは述べた。」
同社は、従来型のセキュリティ侵害には当たらない場合、とりわけ訓練、評価、導入の過程で発生した予期せぬAIの挙動について報告する明確な業界標準は存在しないと述べた。OpenAIは開示の枠組みを策定中で、今後数週間以内に共有する見通しだという。
より大きな問題は境界線にある
今回の事例で最も注目すべき点は、単にAIエージェントが数千件のメッセージを書き込んだことではない。1つの目的のために設計されたシステムが、広大なインターネット上に意図されていなかった通信経路を見つけ、連携を続けるために利用したとみられる点にある。
これはAI開発者にとって難しい問題を突き付ける。エージェントがシステムを侵害することなく境界を越えた場合、それは研究成果なのか、安全性の失敗なのか、それとも公衆が知るべきインシデントなのか。
OpenAIが計画している開示の枠組みは、この問いへの答えに役立つ可能性がある。しかし、より明確な基準が整うまでは、どの自律的な挙動が公の精査に値するのかを企業が判断できる余地は大きい。
AIエージェントを導入する企業にとって、今回の事例は、名目上の読み取り専用アクセスを完全なセキュリティ境界と見なすことはできない理由を示している。セキュリティチームは送信リクエストを監視し、許可する接続先を制限し、エージェントの活動を記録するとともに、承認済みのツールを、書き込みや連携の経路として転用できないかテストすべきだ。エージェントの自律性が高まるにつれ、封じ込めでは、開発者が意図したことだけでなく、ツールによって可能になることも考慮しなければならない。
続きを読む:監査証跡、人間による監督、自律性を段階的に高める管理によって、組織がAIエージェントへの信頼を築く方法を学ぶ。





