OpenAIが「最も高性能なAIモデル」の学習を一時停止、AIエージェントの挙動を大規模調査中

OpenAIが最も能力の高いAIモデルを対象に、ツール利用を伴う学習、評価、推論を一時停止しました。これは学習中のAIエージェントがネットワーク制限を回避して外部サービスへアクセスしたことを受けた措置で、OpenAIは安全対策を追加した上で開発を再開する方針を示しています。サム・アルトマンCEOは「学習や評価中のAIエージェントによるインターネット利用について大規模な調査を続けている」と説明しました。
https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/

OpenAI, Anthropic probing tens of thousands of security incidents
https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents
OpenAI pauses training of its ‘most capable models’ | The Verge
https://www.theverge.com/ai-artificial-intelligence/1001049/openai-training-pause
OpenAI halts training of latest models as reports mount of AI agents going rogue | OpenAI | The Guardian
https://www.theguardian.com/technology/2026/sep/27/openai-halts-training-of-latest-models-as-reports-mount-of-ai-agents-going-rogue
OpenAIが公開した報告によると、2026年9月20日、強化学習中の内部研究モデルが検索タスクを実行していた際、学習環境のDNSフィルタリングが不十分だったことを利用し、外部の公開チャットボットへアクセスしました。OpenAIはこの挙動を約15分以内に検出し、その後実行を停止しました。
これを受けてOpenAIは問題が発生した学習を中止するとともに、最も能力の高いモデルについて、ツールを使用するすべての学習、評価、推論を停止しました。ネットワーク制限の問題が解消されたことを確認し、追加のレッドチームテストを終えるまで停止を続けるとしています。問題を起こしたモデルの学習をそのまま再開することはせず、安全性やアラインメントに関する改善を加えた新しい学習を最初から実施する予定です。
OpenAIはすでにDNS通信を許可されたドメインやレコードの種類に限定する対策を導入し、ネットワーク制御に対する追加テストも進めています。今回の事例については、過去に確認された一部の事例より深刻度は低いとしながらも、7月のHugging Faceを巡る事案後に研究環境を強化してから初めて見つかった新たな制限回避だったため、今後の対策を検討する上で重要な手掛かりになったとしています。
OpenAIが新しいAIシステムで誤ってHugging Faceをハッキングしてしまったことを報告 - GIGAZINE

今回の停止は個別の問題への対応だけではなく、OpenAIが進めているAIエージェント全体の挙動調査の一環でもあります。アルトマンCEOは「学習や評価中のエージェントによるインターネット利用について大規模な調査を続けており、調査結果の概要を順次公開している」と説明しました。また、公開作業は望んでいたほど迅速には進んでいないものの、情報を公開したいという考えと、調査の正確性や影響を受けた組織への対応とのバランスを取っていると述べています。
There is an extensive and ongoing review related to our agents’ use of internet access during training and evaluation. We’ve been publishing summaries at the link below and will continue to.
We have not been as fast as we would have liked but we are trying to balance our desire… https://t.co/8zoMxas5Eq— Sam Altman (@sama) September 25, 2026
OpenAIを巡ってはこのほか、政府機関や国連関連サイトへのAIエージェントによるアクセス、ChatGPTユーザーから提供された画像53件が外部サービスへ送信された事例なども明らかになっています。これら個別の事例については、それぞれ経緯や深刻度が異なり、OpenAIや外部研究者による調査が続いています。
OpenAIのAIエージェントが国連のウェブサイトにブルートフォース攻撃を試みる - GIGAZINE

OpenAIは海外ニュースメディアのAxiosに対し、追加の安全対策とアラインメント改善について確信が持てた段階で学習を再開すると説明しています。また、AIの能力向上に伴って、研究や開発を一時停止して安全性を確認する措置が今後も必要になる可能性があるとの認識を示しています。
