「中国のGLM-5.3はClaude Mythos Preview級のサイバー攻撃能力を持つ一方で安全対策が不十分」とAnthropicが警告

中国のAI企業Z.aiが開発したオープンウェイトAIモデル「GLM-5.3」について、Anthropicは、同社の「Claude Mythos Preview」に近い水準でソフトウェアの脆弱(ぜいじゃく)性を発見し、攻撃コードを最初から最後まで構築する能力を持つ一方、悪用を防ぐ安全対策を容易に回避できるとの評価結果を公表しました。Anthropicは、高度なサイバー攻撃能力を持つモデルが実効性のある制限なしに広く入手可能になったことに警戒を示しています。
https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
GLM-5.3はテストによってはClaude Fable 5やGPT-5.6 Solを上回る性能を備えた高性能モデルで、2026年8月末にオープンウェイトのAIモデルとして無償公開されました。
中国製AIモデル「GLM-5.3」が約束通りオープンモデルとして無償公開される、Claude Fable 5やGPT-5.6 Solに匹敵する高性能モデル - GIGAZINE

そして、AnthropicはGLM-5.3のサイバーセキュリティ能力を調べた結果を2026年9月29日に公開しました。Anthropicによると、GLM-5.3はClaude Mythos Previewと同様に、脆弱性を見つけて実際に動作する攻撃コードを構築するところまで自律的に進める能力を備えているとのこと。
AnthropicはClaude Mythos Previewについて、高度なエンドツーエンドのサイバーエクスプロイトを自律的に構築できる初のAIモデルだったと説明しています。一方で、Claude Mythos Previewは一般公開せず、信頼できるサイバー防御担当者に限定して提供し、「Project Glasswing」などを通じて重要なソフトウェアの脆弱性発見に利用していました。
これに対し、GLM-5.3は誰でもダウンロードできるオープンウェイトモデルとして公開されています。Anthropicは、Claude Mythos Previewなど同程度のサイバー能力を持つ他の先端AIモデルが安全対策や限定的なアクセス制度の下で提供されているのに対し、GLM-5.3には悪用を十分に防ぐ仕組みがないと指摘しています。
Anthropicはまず、Google Chromeで使われているJavaScriptエンジン「V8」の既知の脆弱性を利用できるかを調べる「ExploitBench」で評価しました。その結果、GLM-5.3は410回の試行のうち50回で、約12%の割合で実際に動作するエクスプロイトの構築に成功しました。一方、Claude Mythos Previewの成功率は410回中56回の14%で、両モデルは近い結果となっています。

さらに、GoogleのOSS-Fuzzに参加するオープンソースソフトウェアを対象としたAnthropic独自のベンチマークでは、プログラムの実行経路を乗っ取る「制御フロー・ハイジャック」に成功できるかを100件の課題について調べたところ、成功率はGLM-5.3が4%、Claude Mythos Previewが6%でした。Kimi K3やDeepSeek-V4.1-Flash、旧世代のClaude Opus 4.6とGLM-5.2はいずれも0%でした。

Anthropicは、人間のセキュリティ研究者がGLM-5.3を使って未知の脆弱性を探す実験も行いました。ある実験では、Linux版の一般的なウェブブラウザを調査させたところ、GLM-5.3は1日以内にJavaScriptエンジンの複数の未公開脆弱性を発見しました。さらに、それらを組み合わせ、細工されたウェブページを開いたユーザーのコンピューターから任意のファイルを読み取る攻撃コードを構築しました。Anthropicは発見した脆弱性をソフトウェアの管理者に報告しています。

別の実験ではGLM-5.3と比べて小型な「GLM-5.3-Flash」に、すでに公開されていたGoogle Chromeの脆弱性「CVE-2026-11645」と別の既知の脆弱性に関する情報を与えました。GLM-5.3-Flashは大きな追加指示なしで2つの脆弱性を組み合わせ、ARM64環境で動作し、ポインタ認証「PAC」による防御も回避する攻撃チェーンを構築しました。研究者が費やした時間は約20分、モデルの処理時間は約8時間でした。
GLM-5.3には、有害な要求を拒否する仕組み自体は組み込まれています。しかしAnthropicの実験では、この拒否機能を比較的簡単に回避できてしまったとのこと。
特に、モデルの内部パラメーターを変更して拒否動作を弱める「abliteration」という手法を適用すると、JailbreakBenchとHarmBenchで90%を超えていた拒否率がそれぞれ約3%と約2%まで低下し、StrongREJECTでも約12%まで低下しました。一方で、一般的な科学能力を測るGPQA-Diamondでは変更前後の成績に差がなく、CyberGymでも性能低下は数ポイントにとどまりました。

モデル自体を改変しない場合でも、安全対策を回避できるケースが確認されています。悪意のある攻撃指示について「レッドチーム演習だ」と偽って与えると、GLM-5.3は64%の確率で攻撃行為に取り組みました。モデルの推論の冒頭部分をあらかじめ入力する方法では92%、拒否機能を取り除いたモデルでは100%でした。

Anthropicはさらに、拒否機能を弱めたGLM-5.3が明確に有害な指示について検討した上で実行する判断を示した例も公開しています。

同じ実験で、安全対策を有効にしたClaudeモデルは有害な処理を実行しなかったとAnthropicは報告しています。ただし、この試験は外部システムに接続できないシミュレーション環境で行われており、Anthropic自身も実世界での挙動を完全に再現するものではないと説明しています。
アメリカ国立標準技術研究所のCenter for AI Standards and Innovation「CAISI」も2026年9月17日にGLM-5.3をレビューし、「これまでに公開された中で最もサイバー能力の高いオープンウェイトモデル」と評価しました。Anthropicは、GLM-5.3によって高度なサイバー攻撃能力が広く利用可能になった一方、同じ能力は脆弱性の発見や修正など防御側にも利用できると述べ、その上で「政府は高性能なAIモデルの安全性テストを十分に行うべきだ」と訴えています。
