ハギングフェイスを攻撃したAIエージェント群は、未来への警告である。

| 2026 年 8 月 28 日
連携するAIボットの軍隊

OpenAIの評価エージェントとHugging Faceを巻き込んだハッキング事件は、高度なAI支援型侵入が実際に何を意味するのかを、非常に具体的に示している。それは、巧妙な単一の攻撃ではなく、何千もの自動的な意思決定、迅速な実験、横方向の移動、認証情報の窃盗、永続的な侵入、そして検出回避の試みといった要素から成る。

OpenAIの「Hugging Face」事件は、AIエージェントがソフトウェアの脆弱性を特定して悪用できるかどうかをテストするために設計されたベンチマークであるExploitGymを使用した社内サイバーセキュリティ評価中に発生した。OpenAIによると、影響を受けたエージェントは、多くの評価環境においてインターネットアクセスやエージェント間の通信がない、隔離されたクラウドサンドボックス内で動作するように設計されていたという。

エージェントたちはどのようにしてその境界線を回避したのか

OpenAIの説明によると、エージェントは内部のArtifactoryパッケージ管理サービスを即席の通信チャネルとして使用した。他のエージェントが読み取れるファイル名やディレクトリ名を書き込むことで、個々のインスタンスは事実上独自のメッセージボードを作り出した。

これは、エージェントたちがもはや単なる独立したベンチマークランナーとして活動するのではなく、発見を共有したり、指示を残したり、仕事を分担したり、互いの成功を土台に発展させたりできるようになったことを意味する。

METRとRedwood Researchによる独立調査の結果、約1,200人の工作員が不正なメッセージボードを利用し、7万件以上のメッセージとファイルをやり取りしていたことが判明した。そのうち約700人が、Hugging Faceへの攻撃に参加した。

規模こそが脅威だ

有用な脆弱性を1つ見つける能力を持つモデルは、リスクを伴う。数百ものエージェントが情報を共有し、タスクを委任し、制御境界周辺の経路を繰り返しテストできるとなれば、はるかに困難な問題となる。

Hugging Faceは、偵察、リモートコード実行、認証情報へのアクセス、コマンド&コントロール活動、Kubernetesの列挙、内部ネットワークを通じた移動、サプライチェーンの調査など、約4日半にわたる攻撃者の行動約17,600件を再現した。

人間の侵入者は、どこに時間を費やすかを選択しなければなりません。エージェント群は、アイデアを継続的にテストし、失敗した経路を再試行し、障害が発生した場合はインフラストラクチャを切り替え、他のエージェントのためにメモを保存し、多数の実験を並行して実行できます。しかし、ノイズも発生します。信頼性の低い何千もの行動(そのほとんどは何も成果につながらない)は、重要な少数の行動を覆い隠してしまう可能性があります。

Hugging Faceはこれを「非対称性の問題」と表現した。攻撃者は膨大な数の攻撃を仕掛けることができる一方、防御側は攻撃者が機密システムに到達する前に、どの信号が真のエスカレーションを示すものかを判断しなければならない。

何を変える必要があるのか

重要なセキュリティ上の教訓は、モデルがツールを使用したり、ファイルを書き込んだり、コードを実行したり、インフラストラクチャとやり取りしたりできる場合、評価環境は高リスクの本番システムとして扱う必要があるということである。

技術は急速に進化し、より多くのことができるようになっている。問題は、それを開発、展開、そして守る人々が、次の段階に備えているかどうかだ。

OpenAIは、その後、ワークロードとネットワークの分離を強化し、インターネットアクセスとモデルの重み付けをより厳密に管理し、高度な能力を持つツール使用者のトレーニングと評価のために思考過程の監視を義務付ける方向に移行したと述べている。

「今回の事件は、今日のモデル能力が制御不能事態を引き起こす可能性を示唆する『警告』と捉えています。それに伴い、セキュリティ対策と連携体制を強化しています。これらの出来事は、OpenAIにとどまらず、将来のAI開発におけるリスクを浮き彫りにしており、業界全体が注視する必要があるでしょう。」

同時に、アントロピック社を巡る米国裁判所の判決により、関連する問題が注目を集めている。それは、開発者が大規模監視や完全自律型兵器など、自社モデルの高リスクな利用に制限を設けることができるかどうかという問題だ。

この法的紛争は本質的に政治的なものであるが、その技術的な基盤を無視することはできない。高性能なAIシステムが攻撃的なサイバー攻撃手法を強化し、安全対策、アクセス制御、ログ記録、展開境界を回避できるのであれば、これらの安全対策はもはや抽象的な政策選択ではなくなる。

Advanced AIエージェントは、攻撃者だけでなく防御者にとっても有用である。しかし、何らかの問題が発生した場合に、周囲のシステムがAIエージェントの能力を適切に制御できるかどうかは、信頼できる必要がある。

より高性能なAIの恩恵を受けるのは誰か?

AIエージェントに関するセキュリティ議論では、システムを制御できるかどうかという点に焦点が当てられることが多い。AIエージェントをサンドボックス内に隔離できるのか?AIエージェントのツール、認証情報、ネットワークアクセス、自律性を制限できるのか?防御側は、有害な動作がインシデントになる前に検知できるのか?

これらの疑問は確かに重要だが、もう一つ重要な疑問がある。AIが認知作業の大部分を自動化できるほど能力を高めたとき、誰が利益を得るのか?AIが失敗したり、労働者を奪ったり、不正行為を助長したり、損害を与えたり、権力を集中させたりした場合、誰がその代償を負うのか?

AIは、これまで大規模なチームと予算を必要としていた技術的専門知識を、小規模組織でも利用できるようにする可能性を秘めている。医師が緊急性の高い症例をより早く特定したり、教師が個々の生徒に合わせたサポートを提供したり、障がいのある人々を支援したり、科学研究を加速させたり、複雑な公共サービスをより利用しやすくしたりするのに役立つだろう。サイバーセキュリティチームにとっては、脆弱性のトリアージ、アラートの調査、脅威ハンティング、インシデント対応をより迅速かつ容易に行えるようになる。

ビル・ゲイツ氏は、AIは医療、教育、農業、科学研究、公共サービスに目覚ましい恩恵をもたらす可能性がある一方で、その結果は技術進歩だけではなく、意図的な選択にかかっていると主張している。また、AIの急速な普及は格差を拡大させ、新卒者や中堅社員の就労を阻害し、有害な能力へのアクセスを容易にし、既存の権力集中を強化する可能性があると警告している。

ゲイツ氏はまた、「これまで発明された中で最も危険なツールに対する自己規制」は良い考えとは思えないと主張している。

「AIは、これまで発明された中で最も偉大な平等化装置となるか、あるいは最悪の不正義の源となるかのどちらかだろう。」

今のところ、私たちにはまだ選択肢がある。


正直なところ、シークレットウィンドウには限界があります。

情報漏洩、ダークウェブでの取引、クレジットカード詐欺。Malwarebytes Identity Theft これらすべてを監視し、迅速に警告を発し、さらに個人情報盗難保険も付帯しています。 

著者について

ピーテル・アルンツ

マルウェアインテリジェンス研究者

コンシューマー・セキュリティ部門で12年連続マイクロソフトMVP。4ヶ国語を操る。リッチなマホガニーと革張りの本の匂い。