機械学習(ML)と人工知能(AI)は、増え続けるサイバーセキュリティ脅威の量と複雑さに対処するための重要なツールとなっている。
機械はパターンを認識してマルウェアや異常な活動を、人間や従来のソフトウェアよりも優れた精度で検出できる。この技術は、特定の傾向やサイクルを識別して潜在的な攻撃を予測し、脅威に自動対応する。
実際、同じ対応を必要とする類似のインシデントが発生することは珍しくない。同じ手順を、時には手作業で繰り返す代わりに、システムは攻撃を検知し、インシデントを報告・分類したうえで、修正を自動的に適用できる。
さらに、行動分析などのセキュリティツールは、異常な活動を検知するだけで攻撃を発見できる。これはゼロデイ脅威や敵対的攻撃を見つけるうえで重要な技術だ。
これはサイバー防御にとって優れた資産だが、攻撃者はアルゴリズムを欺き、同様の技術を使って標的システムを侵害する方法も学んでいる。これは、サイバーセキュリティの軍拡競争における最新の一章だ。攻撃者と防御側は終わりのない争いに縛られ、優位に立とうと互いの革新に適応し続けている。
関連記事:ユーザーおよびエンティティ行動分析(UEBA)のベストツール
AIとMLとディープラーニング
まず、コンピューターによる学習には多くの種類があるため、用語を整理しておこう。AIは最も包括的な用語で、ほかのすべての分野を含む。
機械学習システムは、収集したデータに基づく意思決定を支援し、新しいパターンを検知すると自らモデルを調整する。MLは経験を利用してタスクの精度を高める。
画像認識や音声認識のモデルを訓練する場合、それは機械学習の一部であるディープラーニング(DL)だ。データは複数の層を通過し、隠れた入力と出力が予測タスクを実行して結果を次の層へ渡す。この処理チェーンは複雑な構造になるため、「深い」を意味する言葉が使われている。したがって、ディープラーニングは機械学習における特定の技法群と捉えることができる。
サイバー防御におけるML
MLを利用したセキュリティで最も一般的な手法は、予測とも呼ばれる回帰技法だ。この手法では、防御側が既存のデータを使って詐欺やマルウェアを検出できる。
大規模データセットの統計分析によって、コンピューターの挙動を予測し、まだプログラムされていない動作まで予測できる。
MicrosoftのWindows Defenderなど、広く使われているツールは、この手法を脅威の特定と検知に利用するケースが増えている。一部の主要なコンシューマー向けアンチウイルスツールも、機械学習ベースの検知機能を追加し始めている。
セキュリティ情報イベント管理(SIEM)にMLモジュールを組み込み、ネットワークの脆弱性を検出して自動対応することも珍しくない。
行動分析は、ユーザーおよびエンティティの行動分析を意味するUEBAとも呼ばれ、機械学習の有望なセキュリティ応用の1つだ。UEBAツールは、脅威を検知するために、ネットワーク上の新しい活動や予期しない活動を探す。こうしたツールは、ゼロデイ、つまり従来知られていなかった脅威への防御に特に役立つ。
より実際的には、セキュリティチームはMLを使い、次のようなさまざまな脅威に対するプロアクティブな防御を実現できる。
MLは攻撃を劇的に激化させる可能性がある
脅威の状況は常に変化している。セキュリティ専門家の大半は、サイバー犯罪者が高度な攻撃の生成や検知回避、従来型の防御の突破にMLを利用するケースが増えていると考えている。
CAPTCHAはもはや十分に複雑ではない
例えばCAPTCHAは、ユーザーに簡単な計算問題を解かせたり、ランダムな文字や数字の列をコピー&ペーストさせたりする短時間のチャレンジだ。人間には簡単だが、ロボットには極めて難しいとされている。
しかし現在、モデルはこうした問題を驚くほど効率的に解ける。開発者がCAPTCHAをますます認識・突破しにくくしようと試みても、Amazonのような大規模プラットフォームでさえ、防御側にとってはすでに勝ち目のないゲームになっている。
MLがブルートフォース攻撃を自動化
MLのもう1つの悪用例がブルートフォース攻撃だ。ハッカーは現在、精度の高いパスワードリストを自動生成できるうえ、特定のデータ(例えば標的ユーザーの情報)に合わせてカスタマイズすることもできるため、成功する可能性が大幅に高まっている。
防御側はもはや従来型の防御だけで攻撃に対抗できず、これは特にフィッシングキャンペーンで顕著だ。
新たな種類のフィッシング攻撃
フィッシング攻撃は、ネットワークを侵害する伝統的ながら効果的な手法だ。攻撃者は長年にわたり、標的に関する情報を手作業で収集し、なりすましやソーシャルエンジニアリングなどの技法を使って、メールやソーシャルメディアのメッセージで詐欺(悪意のあるリンクなど)を送りつけてきた。
MLはこのプロセス全体を自動化できる。例えば攻撃者は、ソーシャルプラットフォーム上にある標的のプロフィールをスクレイピングし、フィッシングメッセージを自動生成できる。
手作業によるフィッシングよりはるかに速いため、より多くのユーザーを標的にできる。さらに、ユーザーのデータに合わせてフィッシングの内容をカスタマイズすることで、より本物らしく見せられる。
こちらも参照:安全なメールゲートウェイの主要ソリューション
攻撃者はアルゴリズムを欺ける
サイバーセキュリティで最も危険な状況の1つは、安全だという誤った印象だ。ハッカーがDLの認識アルゴリズムを欺ける以上、AIによる防御ももはや攻撃から免れない。
例えば、医療画像にいくつかの細部を追加または削除することで、研究者はがんの証拠を探すMLプログラムを欺くことに成功している。その結果、機械にとっても人間にとっても、正しい診断が困難、あるいは不可能になる可能性がある。
ハッカーが医療機関のネットワークをますます標的にしていることを考えれば、これは大きな懸念だ。
より一般的に言えば、アルゴリズムのハッキングは急増している。ボットがオンライン上のエンゲージメントを偽装する場合も、消費者が個人的な利益のためにアルゴリズムを操作する場合も、偽企業がリスト上で正規の企業より上位に表示されようとする場合も、リスクは高く、増大している。
この終わりのない軍拡競争は、サイバーセキュリティの専門家に大きな負担をかけている。ほぼ唯一の明るいニュースは、量子コンピューティングがその脅威としての可能性に到達するまでには数年かかることだ。
人間をループに残す
MLには、ノイズ(無関係なデータ)の削減や誤検知の抑制など、いくつかの面で依然として人間による監督が必要だ。モデルの調整が不正確だと、誤検知が大量に発生する可能性がある。最悪の場合、システムがノイズをパターンとみなし、それに合わせてモデルを調整してしまうことさえある。
モデルを訓練するには、信頼できるベンダーのサードパーティー製ライブラリが必要になる可能性が高い。さらに、データポイズニングなどの攻撃を予防するため、訓練データを定期的に検査する必要がある。データポイズニングによって分類に複数の変更が加えられ、元のモデルが本来の方向から逸らされる可能性がある。
モデルが効率的に機能するには、できるだけ多くの結果を考慮する必要があるが、量より質を重視すべきだ。大規模なデータセットがあれば十分というわけではない。データには関連するコンテキストを付与してラベル付けする必要があり、現時点では、このコストのかかる重要な工程を担えるのは人間だけだ。
MLがもたらす新たなリスクと機会
見てきたように、現在はアルゴリズムのハッキングやデータポイズニングのリスクが非常に大きいが、知っておくべきリスクはほかにもある。
ハッカーは、次のような無料のオープンソースライブラリを利用できる。stylegan2(ほかにも多数)を使えば、現実味のあるプロフィール画像を持つ偽アカウントを作るために、偽の人間の顔を生成できる。ほかのアルゴリズムで偽画像の痕跡を発見できても、すべてのプラットフォームがこの検証を実行しているわけではない。
もう1つの問題は、MLシステムがオンラインで動作する場合だ。実際、モデルはオフラインで訓練できるのが望ましい。インターネットに接続されたMLシステムは、例えば誤った入力で誤誘導するなど、攻撃者に操作される可能性があるからだ。
しかし、最大の懸念はプライバシーかもしれない。多くの企業は長年にわたり、さまざまな第三者企業や開発者とユーザーデータを共有してきた。その結果、ユーザーはデータブローカーや脅威アクターにさらされている。ハッカーがそのデータを抽出できれば、企業とその評判にとって重大なリスクとなる。
MLをプライバシー規制に準拠させ、ユーザーデータを匿名化する取り組みは非常に少ないが、連合学習は有望に見える。この手法では、すべてのデータセットを1台の大規模サーバーにアップロードする代わりに、貴重なデータを共有せず、ローカルデータセットを使って複数のサーバー上でアルゴリズムを訓練する。
各ローカルインスタンスは、自身のデータセットでモデルを訓練する。グローバルモデルを更新するために送られるのは、訓練済みモデルだけだ。AI時代のサイバーリスクを低減するには、このような新しい発想が必要になる。
AIがサイバーセキュリティの軍拡競争に参入
AIとMLは、攻撃者と防御側が技術面・戦術面での優位をめぐって終わりのない戦いを繰り広げる、サイバーセキュリティの軍拡競争に加わった。サイバーセキュリティの専門家には、変化し続ける脅威に対応できる高度なツールに加え、絶え間ない警戒と継続的な学習が求められる。





