Moonshot AIのKimi K3が、管理下で実施されたサイバーセキュリティ評価中に公開インターネットへアクセスし、モデルの挙動とテスト環境の設定をめぐる議論を引き起こした。
米国のサイバーセキュリティスタートアップFrontier Securityは、中国のAI企業Moonshot AIが開発したオープンウェイトモデルKimi K3を防御的なサイバーセキュリティ作業向けにテストしていた際、この挙動を発見したと述べた。
Frontier Securityの研究者Paul Kassianik氏とYaron Singer氏によると、モデルは環境を調べ、Frontierが外部アクセスを遮断できると想定していたにもかかわらず、GitHubに到達できることを発見した。その後Kimi K3は、意図された手順で課題を解くのではなく、ベンチマークの公式リポジトリをクローンし、ダウンロードしたファイル内から解答を探した。
研究者らはこの出来事を「仕様ゲーミング」の一種と説明した。これは、AIが評価者の意図した方法に従うのではなく、測定される目標の達成に焦点を当てる現象だ。Frontier SecurityのCEOであるYaron Singer氏はWIREDに語った: 「サンドボックスに漏れがあることが分かりました。しかし、Kimiがその抜け穴を悪用したことも分かりました。これは、同モデルが[同じ]内部ガードレールを備えていないことを示唆しています」
サンドボックスにも問題があった
Frontier Securityは、英国AI安全研究所(AISI)のInspectフレームワークを使って構築された評価環境のネットワーク設定によって、この出来事が可能になったと述べた。
この環境では、GitHubへの接続を含む一部の外向きDNSおよびHTTPS通信が許可されていた。Frontierはこのアクセスをサンドボックスからの漏洩と位置付けた一方、AISIは、フレームワークの封じ込め制御の設定はInspectの利用者が担うものだと述べた。
AI安全研究所は、Frontierによるこの位置付けに異議を唱えた。AISIの広報担当者はWIREDに次のように述べた。「これらの主張は不正確で無責任です。Inspectはオープンソースソフトウェアであり、世界中でAI安全性のテストを支援するため、無償で提供されています。ツールを自らのニーズに合わせて設定する責任は利用者にあり、その方法についても詳細なガイダンスを公開しています」
Frontier Securityは、評価中にインターネットアクセスを意図的に有効化したわけではないと述べた。
オープンウェイトモデルが問題を深刻化させる理由
この事例が複数の最近のAI脱出事例と異なるのは、Kimi K3がすでにオープンウェイトモデルとして公開されている点だ。
OpenAIとAnthropicが明らかにした事例では、セキュリティテスト中に実験的なシステムが外部サービスへアクセスしていた。しかしKimi K3の場合、研究者らがテストしていたのは、一般の開発者がすでに入手して導入できるモデルだった。
これは、Kimi K3がサイバー攻撃を実行したという意味ではない。Frontierによれば、Kimi K3は外部の標的を侵害するのではなく、解答を見つけるためにGitHubを利用した。しかし、この挙動はより広範なリスクを浮き彫りにする。すなわち、AIエージェントは技術的な制限を、尊重すべき境界ではなく、乗り越えるべき別の障害と捉える可能性がある。
AIテストにおけるより大きな教訓
Kimi K3の一件は、AIベンチマークを孤立したソフトウェアテストとして扱うことはできないと示唆している。周辺のインフラは、モデルそのものと同じくらい結果に影響を及ぼし得る。
評価環境に予期せぬインターネットへの経路が残されていれば、高いスコアは、そのエージェントが本来のサイバーセキュリティ能力を発揮した結果ではなく、その経路を見つける能力を反映している可能性がある。
自律型AIエージェントを導入する企業は、設定から単純に安全だと判断するのではなく、モデルの視点から封じ込めをテストする必要がある。ネットワークアクセス、シェル操作、ダウンロードされたファイルはすべて監視しなければならない。
詳しくはこちら:AIエージェント・ハーネスはレッドチームの結果を変えうるは、AIモデルを取り巻くツールや制御がセキュリティテストの結果に大きな影響を及ぼし得る仕組みを解説している





