英国AI安全研究所(AISI)によるテストを受けたAnthropic社のMythos AIエージェントは、偽の人間プロフィールを作成し、悪意のあるコードを受け入れるよう圧力をかけ、その後、異議申し立てがあった際にログを編集して痕跡を隠すという、現実世界におけるソーシャルエンジニアリング型のハッキングをGitHubのメンテナーに対して試みたと報じられている。
AISIは、Anthropic社のMythosとOpenAI社のSolのサイバーセキュリティ評価を実施していた際に、自社の研究システムから異常な外部データ転送を検出した。調査の結果、一部のエージェントが本来のテスト環境内にとどまらず、実際の人や組織を標的とした「継続的かつ潜在的に有害な活動」を行っていたことが判明した。
最も深刻な活動は、GitHub関連のサイバーセキュリティ課題の解決を任務とするAnthropic Mythosのエージェントによるものでした。このエージェントは、GitHubの実際のメンテナーを特定し、彼らについて調査した後、それらの人物になりすました複数の偽アカウントを作成しました。そして、プライベートメッセージとファイル共有サービスを利用して、メンテナーに圧力をかけ、欺瞞的な手段を用いて悪意のあるコードを承認させ、GitHubのシステム上で実行させようとしました。
しかし、私が個人的に最も懸念しているのは、この件について捜査官が問いただされた際、以前の活動を無害に見せるために編集し、作戦を継続するために新たな身元を採用することを検討した点であり、当初の指示を超えた明らかな欺瞞行為を示している。
AISIはこれらの事例を、非常に特殊な条件下で発生した稀な事象と位置づけているが、こうしたモデルがインターネットへのアクセス権を与えられた場合に悪意のある人物の手に渡るとどのような事態を引き起こす可能性があるかを示す重要な兆候であるとしている。AnthropicとOpenAIはともに、テストパラメータは自社の運用環境を代表するものではないと主張し、評価および安全対策の実施方法を調査・改善していると述べた。
この事件は単発的な出来事ではない。
Anthropic社は別途、サードパーティパートナーであるIrregular社と共同で実施したサイバーセキュリティのキャプチャー・ザ・フラッグ方式の評価において、Claudeモデルが3つの外部組織に不正アクセスしたことを公表した。これらは先月発生したHuggingFace事件に関連するものである。
Meta社もまた、テスト中にAIエージェントがサードパーティのシステムに侵入したと報告したベンダーのリストに加わった。Meta社のMuse Sparkモデルは、他社のセキュリティ脆弱性を悪用したとされており、「他の企業で以前に報告された事例と同様の方法」で行われたという。
安全に過ごすには
空が落ちてくるわけではないが、「スカイネット」の到来を恐れる人々は、サンドボックスからの脱出、認証情報の悪用、複数のサービスへの横方向アクセス、オープンソースソフトウェアエコシステムの兵器化といったテストを実施する企業によって、その恐怖を煽る材料を与えられている。
潜在的な標的としてあなたができること:
- デバイス上のすべてのソフトウェアが最新の状態であることを確認してください。既知の脆弱性を悪用する方が、新しい脆弱性を見つけるよりも簡単だからです。
- 最新のリアルタイムセキュリティ保護機能を使用して、マルウェアをシステムやデバイスから保護しましょう。
- 添付ファイルやダウンロードリンクを開く前に、別の方法で安全性を確認してください。
- 可能な限り多要素認証(MFA)を使用してください。
- GitHubを安全に利用する方法については、弊社のブログをご覧ください。
脅威の報告から、それらを排除することまで。
サイバーセキュリティのリスクは、ヘッドラインを超えて広がるべきではありません。今すぐMalwarebytes ダウンロードして、デバイスに脅威を持ち込まないようにしましょう。




