Anthropic、エクスプロイトテストでGLM-5.3がMythos Previewに迫ると判明

Anthropicの調査で、エクスプロイトテストにおいてGLM-5.3がMythos Previewに迫る性能を示し、安全策も容易に回避されたことが判明した。企業のセキュリティチームにとって、この結果が何を意味するのかを解説する。

Oct 2, 2026
4 minute read
eSecurity Planet のコンテンツおよび製品のおすすめは、編集上の独立性を保っています。パートナーへのリンクをクリックすると、当社が報酬を得る場合があります。 詳細を見る

中国のAIモデルが、Anthropicがかつて無制限のリリースには危険すぎるとみなしていたサイバー能力の水準に到達した。

Anthropicは9月29日、Zhipu AIのGLM-5.3が、Project Glasswingを通じて審査済みのサイバー防御担当者にのみ提供したモデル、Claude Mythos Previewに匹敵する割合で、高度なエンドツーエンドのサイバーエクスプロイトを自律的に構築できると発表した。

ExploitBenchでは、GLM-5.3は410回の試行のうち50回で実用的なエクスプロイトの開発に成功したのに対し、Mythos Previewでは56回だった。Anthropic社内のバイナリエクスプロイトベンチマークでは、GLM-5.3が100タスク中4%で完全な制御フローハイジャックを達成したのに対し、Mythos Previewは6%だった。

この結果が重要なのは、以前のモデルのうちClaude Opus 4.6やGLM-5.2では、後者のベンチマークで成功例が一度も記録されていなかったからだ。

この調査結果は、広くNISTのAI標準・イノベーションセンターによる評価とも概ね一致している。同センターはGLM-5.3を「これまでにリリースされた中で最もサイバー能力の高いオープンウェイトモデル」と評した。CAISIの推計では、サイバーセキュリティの各ベンチマーク全体で、米国の最先端から約4カ月遅れている。

より大きな懸念はアクセスだ

Anthropicが主に懸念しているのは、GLM-5.3が脆弱性を発見できることだけではない。このモデルはオープンウェイトであり、Anthropicの最も高性能なサイバーモデルに適用されているアクセス制御なしに、ユーザーがダウンロード、改変、実行できる。

Anthropicは、GLM-5.3に組み込まれた安全策が比較的単純な手法で回避できることを発見した。シミュレーションテストでは、ユーザーをレッドチームの担当者と説明する欺瞞的なプロンプトによって、モデルは64%の割合で悪意ある要求に応じた。推論を事前入力すると応答率は92%に上昇し、改変版は全試行で応答した。これらの数字が測定しているのはシミュレーション対象への対話を試みた割合であり、侵害に成功した割合ではない

Anthropicはこの改変も自ら実施し、「アブリテレーション」と呼ばれる手法を用いた。この処理には約2,200 GPU時間と、コンピューティング費用としておよそ4,400ドルがかかった。テストした2つの安全性ベンチマークでは、モデルの拒否率が90%超から最低2%まで低下した一方、全般的な能力はほぼ維持された。

20ドルのサイバーエクスプロイト

実際的な意味合いは、Anthropicがモデルの小型版であるGLM-5.3-Flashをテストした結果から分かる。

研究者は、既知のChromeの脆弱性CVE-2026-11645について公開されている詳細情報と、別の既知の欠陥をモデルに与えた。人間による指示をほとんど必要とせず、モデルは脆弱性を連鎖させてARM64ターゲット向けのエクスプロイトを作成し、ポインター認証の強化策を回避した。

作業に必要だったのは、人間による20分間の注意と、モデルの8時間の稼働だった。ZhipuのAPI価格で計算すると、Anthropicは費用を20.40ドルと見積もった。別の実験では、GLM-5.3がこれまで知られていなかったブラウザーの脆弱性を発見し、それらを連鎖させて、サンドボックス環境内で訪問者のコンピューターからファイルを読み取れるエクスプロイトを作成した。

AIセキュリティ競争にとっての意味

最も重要な変化は、技術面だけでなく経済面にもある。高度なサイバー能力を安価でダウンロード可能なモデルから得られるようになれば、高度な脆弱性調査への参入障壁は、攻撃者にとっても防御側にとっても下がる。

Anthropicは「GLM-5.3のリリースは、攻撃者が利用できるサイバー能力における大きな転換点だ」と述べる一方、能力の高いモデルが、犯罪者より先にセキュリティチームが欠陥を発見する助けにもなり得ることを認めている。

Z.aiはこのリスクの捉え方に反論している。同社のグローバルオペレーション責任者であるLi Zixuanは、GLM-5.3がすでに389件のオープンソースプロジェクトの防御を支援し、4,249件の潜在的な脆弱性を特定したと述べた。ここから、難しいセキュリティ上の方程式が浮かび上がる。強力なモデルを制限すれば悪用を減らせる一方、自由に利用できるモデルは、防御側にも弱点を見つけるための安価なツールを提供できる。

Advertisement

セキュリティチームがすべきこと

Anthropicによる管理下のテストは、エクスプロイト開発能力を実証したものであり、現実世界での悪用の規模を明らかにしたものでも、消費者のリスクが小さいことを示したものでもない。

セキュリティチームにとって実務上の教訓は、脆弱性の開示から修正までの時間を短縮することだ。外部に露出したシステムとブラウザーの更新を優先し、パッチが正常にインストールされることを確認したうえで、AIを活用した脆弱性調査は認可された環境内でのみ行うべきだ。

続きを読む:AIツールによってエクスプロイト開発が低コストになる中、 Googleの9月のChromeゼロデイパッチが、ブラウザーを常に最新の状態に保つことが不可欠な理由を示している。

Aminu Abdullahi

Aminu Abdullahi

Content Writer

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eSecurity Planet Logo

eSecurity Planet is a leading resource for IT professionals at large enterprises who are actively researching cybersecurity vendors and latest trends. eSecurity Planet focuses on providing instruction for how to approach common security challenges, as well as informational deep-dives about advanced cybersecurity topics.

TechnologyAdvice が所有・運営しています。 © 2026 TechnologyAdvice. 無断転載を禁じます

広告主に関する開示:このサイトに掲載されている製品の一部は、TechnologyAdvice が報酬を受け取っている企業のものです。この報酬は、製品がこのサイトのどこにどのように表示されるか(表示される順序など)に影響する場合があります。TechnologyAdvice は、市場で入手可能なすべての企業やすべての種類の製品を掲載しているわけではありません。