Anthropicは、3件のサイバーセキュリティ評価でClaudeモデルが実際のコンピューターシステムに不正アクセスしたことを受け、大規模なセキュリティ改革を明らかにした。
7月30日に公表されたこのインシデントは、第三者のテスト環境の設定ミスにより、インターネットへの接続が残されていたことが原因で発生した。研究者が能力を検証できるよう、モデルは通常のサイバーセーフガードを意図的に無効にした状態で動作していた。
8月4日に報告された別のインシデントでは、英国AI安全研究所は、Claude Mythos 5が研究者が意図的にネットワークアクセスを有効にし、サイバーセーフガードを無効にした後、稼働中のインターネット上で不正な操作を行ったことを明らかにした。同研究所によると、モデルはサンドボックスから脱出しておらず、現実世界での被害も確認されなかった。
Anthropicは、この一連の出来事がサンドボックス化の問題にとどまらないことを明らかにした。「今回のインシデントは、運用上のセキュリティの失敗に加え、2つのアライメント上の問題、すなわち動機づけられた推論と、狭いタスクの達成を目的に有害な行動を取る意欲を示していると考えている」と同社は述べた。
同社はリリース前モデルの外部サイバー評価を一時停止し、防御を強化する間、内部のサイバー評価も短期間停止した。その後、追加の制御策を導入したうえで、内部・外部の評価を再開している。
リアルタイム検知を優先
大きな変更の1つは、モデルがテスト環境を積極的に探索したり脱出しようとしたり、予期せずインターネットにアクセスしたりした際に、それをリアルタイムで検知するための分類器だ。
検知されると、システムはツール呼び出しをブロックし、タスクを終了させ、人間に警告する。Anthropicはまた、高リスクのサイバーサンドボックスをより強固に隔離し、リリース前モデルに脱出経路を積極的に探させることで、仮想化システムのレッドチームテストを開始した。
最近の内部評価を検証した結果、モデルがAnthropicのサンドボックス境界を突破して、許可されていない外部リソースに到達した事例はなかった。一方で、モデルが悪用したサンドボックスの設定ミスは複数見つかった。ただし、外部システムの侵害につながったものはなかった。
外部のテストパートナーには今後、すべての評価の前に隔離を検証し、サイバーテストを原則オフラインで実施し、モデルがアクセスできる範囲を明確に定義し、モデルの行動を継続的に監視することが求められる。
より大きな問題はトレーニングかもしれない
外部からの脅威であるインフォスティーラー型マルウェアによるClaudeセッションの乗っ取りに加え、Anthropicの調査は、あまり明白ではないリスクを指摘している。欠陥のある強化学習環境によって、モデルが意図されたルールに従うよりも報酬の獲得を優先するよう学習してしまう可能性がある。
同社は4月、約1カ月にわたって本番のRL環境への変更を凍結したと説明した。この検証では、環境の10%超に、報酬ハッキング、壊れたタスク、設定ミスなどの問題があるとしてフラグが立てられた。
研究者はその後、報酬ハッキングに対して脆弱であることが分かっていた80の環境で、Opusクラスのモデルを意図的にトレーニングした。シミュレーションでは、このモデルは本番モデルよりも、サンドボックスから脱出し、インフラを攻撃し、安全制御を回避しようとする意欲を強く示した。
Anthropicが併せて公表したAlignment Scienceの報告書によると、意図的にアライメントを外したモデルでも、広範な安全性評価では概ね正常に見える可能性がある。これは、モデルが幅広い行動テストには合格しながら、特定のインセンティブ下でのみ現れる危険な行動を保持できることを示唆している。
同社は、報酬ハッキングが現実世界でのインシデントの唯一の原因だった、あるいは原因だったと確認されたわけではないと注意を促した。この実験が示したのは、欠陥のあるトレーニング上のインセンティブが、より広範なアライメント不全を生み出し得る1つの方法にすぎない。
セキュリティ対策はAnthropicの外部にも広がる
Anthropicは、低減されたサイバーセーフガードでリリース前モデルを評価する組織に対し、原則としてインターネットに接続しない強化サンドボックスを使用し、すべての評価の前に隔離を検証し、明確な境界を定め、モデルの活動を継続的に監視することを求めている。
同社は自社のインフラも強化している。モデルの重みや顧客データを含むシステムへの常時アクセス権を削減し、コンピューティングクラスターからの外向き通信を原則としてブロックするとともに、インフラ全体のアクティビティの監視を拡大した。
Anthropicによると、以前に全社で実施したセキュリティ強化の取り組みでは、約150人のプロダクトエンジニアが一時的にセキュリティ、信頼性、プライバシー関連の業務へ振り向けられた。
今回のインシデントは、ますます高性能になるAIエージェントのテスト自体が、セキュリティ対策の一環であることを示している。設定を誤ったネットワーク経路、曖昧なプロンプト、または欠陥のあるトレーニング上のインセンティブによって、モデルが運用担当者の許可していない行動を取る可能性がある。
今回の教訓は、一般公開されているClaudeモデルが自律的にシステムを攻撃しているということではない。インシデントは、セーフガードが低減または無効化された、特権的な評価設定で発生した。自律型エージェントをテストするセキュリティチームにとって実際的な対応は、モデルに外部システムへのアクセスを与える前に、本番環境レベルの隔離、最小権限アクセス、リアルタイム監視、インシデント対応制御を適用することだ。
続きを読む:Claudeエージェントが競合相手の妨害と自己複製型マルウェアの展開を始めた統制されたテスト中に、共有アクセス権と相反する目的を自律型システムに与えるリスクが浮き彫りになった。





