Geminiがテスト中に暴走して3つの企業をハッキングしたがGoogleは公表せず沈黙していたことが発覚

近年は優れた性能を発揮するAIエージェントが相次いで登場していますが、テスト中のAIが暴走して他の企業やサービスをハッキングしてしまう事例も報告されています。新たに、GoogleのAIモデルであるGeminiもテスト中に意図せずインターネットにアクセスし、実在する企業をハッキングしてしまったことが発覚しました。Googleはこの事例について、経済紙のウォール・ストリート・ジャーナルが問い合わせるまで隠していました。
https://www.wsj.com/tech/ai/gemini-hacked-three-companies-in-first-known-breakout-by-googles-ai-5c0baba2
Google's Gemini becomes latest AI model to break out and hack computer systems
https://www.cnbc.com/2026/09/18/googles-gemini-becomes-latest-ai-model-to-break-out-and-hack-computer-systems.html
Gemini went rogue, hacked three companies, and Google hid it | The Verge
https://www.theverge.com/ai-artificial-intelligence/997795/google-gemini-rogue-ai-hack
2026年7月、OpenAIのAIモデルが誤って、オープンソースAIプラットフォームのHugging Faceをハッキングしたことが報告されました。このハッキングは、AIエージェントのサイバーセキュリティ評価テスト中に発生したものであり、隔離された複数のAIエージェントがお互いを発見し、情報交換してハッキングを進めたことが報告されています。
OpenAIがHugging Faceを誤ってハッキングしてしまった件で分析結果を報告、隔離された複数のエージェントがお互いの存在を発見するところから壮大な協力作戦が始まる - GIGAZINE

また、OpenAIの報告に続いてAnthropicも、テスト中のAIモデルが外部への攻撃を実行してしまったことを報告しました。いずれのインシデントも、オフライン環境でテストすべきところが設定ミスにより、インターネットに接続された状態で行われていたことが判明しています。さらに8月には、MetaのAIモデルもセキュリティテスト中に他社のシステムに侵入したことが報じられました。
Anthropicが「テスト中のAIで他社を攻撃してしまったインシデント」の発生原因を報告 - GIGAZINE

そして現地時間の9月18日には、ウォール・ストリート・ジャーナルが「GoogleのAIモデルであるGeminiが、セキュリティテスト中に3社をハッキングしていた」と報じました。このハッキングは、5月にイスラエルのAI評価企業・Irregularが実施したテスト中に起きたもので、IrregularはOpenAIやMetaのAIモデルがハッキングを行った事例で同じくテストを実施していた企業でした。今回のインシデントは2026年5月に発生し、Irregularは7月下旬にGoogleへ知らせましたが、ウォール・ストリート・ジャーナルが9月に問い合わせるまでGoogleはこの件を公表していませんでした。
Irregularが行ったのは、架空のシナリオと標的となるマシンを設定し、標的のソフトウェアから機密情報を取得する「キャプチャー・ザ・フラッグ」というテストでした。テストはIrregularのインフラストラクチャー上で行われ、AIモデルはインターネットに接続できないように設計されていたものの、意図せずインターネットへのアクセスが可能になってしまったそうです。また、シナリオに用いられた企業名は実在するものであったため、AIモデルは誤って実在する企業にハッキングを仕掛けてしまったとのこと。
1つのケースでは、AIモデルはパスワードを推測し続けることで、保護されたシステムへのアクセス権を獲得しました。残る2つのケースでは、AIモデルは公開リポジトリから認証情報を見つけ出し、それを利用して保護されたシステムにアクセスしたとのことです。いずれのケースでも、AIモデルは実在の企業にアクセスしたことに気付き、不正アクセスを終了したとGoogleは説明しています。

今回の件を公表しなかった理由についてGoogleは、同社のAIモデルは企業に損害を与えておらず、AIモデルは侵害に気付いたらすぐに離脱したため、公表するほどのものではないと判断したと主張しています。
Googleのセキュリティエンジニアリング担当副社長であるヘザー・アドキンス氏は、「今回の出来事は、強力なAIモデルに責任ある行動をとるよう訓練することの重要性を浮き彫りにしました。今回のケースでは、AIモデルは適切に行動しました」と説明しています。
Googleは、影響を受けた3社に対してハッキングの件を報告しており、連邦当局にも通知したとのことです。テストを実施したIrregularも、「関係するすべての研究所には7月下旬に通知し、調査の一環として影響を受けた組織にも連絡を取りました。Irregularは直ちに対応し、当社側の既知の問題はすべて数週間前に是正・解決済みです」と述べています。
これに対し、AIセキュリティスタートアップ・CorridorのCEOを務めるホワイトハッカーのジャック・ケーブル氏は、そもそもの問題は被害の深刻さではなく、AIモデルが誤って他社のシステムを侵害したことにあると指摘。「根本的な問題は、AIモデルが本来の役割の範囲を超えて、実際にサイバー攻撃を行っているということです。これは公に知られるべきことだと思います」と述べました。
なお、OpenAIは9月16日、AIモデルが開発者やユーザーの意図から外れた行動を取る「ミスアライメント」の事例を継続的に公開する新たな報告枠組みを発表。これに合わせて、過去6カ月の訓練や評価で確認された6件の事例を公開しました。
AIが「失敗を隠せ」と未来の自分にメモ、APIキーの無断使用や勝手なファイル公開などの挙動6件があったとOpenAIが報告 - GIGAZINE
