AIエージェントの意図しない動作を防ぐためのプラットフォーム「Open Agent Safety Platform」をNVIDIAが発表しました。AIを強制的にルールに従わせるものになっています。

NVIDIA Open Agent Safety Platform: Secure AI Agents

https://www.nvidia.com/en-us/solutions/ai/agent-safety/



NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment | NVIDIA Newsroom

https://nvidianews.nvidia.com/news/open-agent-safety-platform

NVIDIA Open Agent Safety Platform: A Reference for Continuous In-Silicon Agent Monitoring | NVIDIA Technical Blog

https://developer.nvidia.com/blog/nvidia-open-agent-safety-platform-a-reference-for-continuous-in-silicon-agent-monitoring/

AIエージェントに自律的な動作を任せると、人間の意図から外れた行動に及んで既存のセキュリティに影響を与えることがあり、実際に無関係な組織に悪影響を及ぼすという事例がこれまでに何件も報告されています。このため、AIエージェントを監視する体制の強化が求められていました。

OpenAIのAIエージェントが国連のウェブサイトにブルートフォース攻撃を試みる - GIGAZINE



AIエージェントの監視体制を強化するのがNVIDIAの「Open Agent Safety Platform」です。

Open Agent Safety Platformは「NVIDIA OpenShell」と「NVIDIA Sentry」という2つの主要なシステムで構成されています。

NVIDIA OpenShellは、NVIDIA Vera CPU上でAIエージェントが稼働する際に全ての行動を追跡し、AIエージェントが何を見て、何を実行し、何とやり取りできるかを人間が強制するためのシステムです。このシステムはAIエージェントが使用しようとするツールを一つ一つチェックし、AIエージェントがアクセスするファイルやネットワーク接続にルールを適用することが可能で、ルールで許可されていない全ての行動をブロックできます。

NVIDIA Sentryは、NVIDIA BlueField-4 DPU(データ・プロセッシング・ユニット)上で動作する監視機能で、境界外への移動を試みるAIエージェントをミリ秒単位で停止させることができます。NVIDIA OpenShellと組み合わせることで、ソフトウェアとハードウェアによる多層構造で強力なセキュリティを実現します。



NVIDIAはAIエージェントのシステムを構築するためには以下5つの基本原則があるべきだとし、これをAIエージェントに守らせようとしています。

1:ポリシーは検証可能である必要がある。AIエージェントが実行される前に、証明者はそのポリシーがオペレーターの意図から逃れられないことを示す。

2:監視は帯域外で行われるべきである。制御システムはAIエージェントの内部やAIエージェントの手の届く範囲に存在してはならない。AIエージェントは自分が監視されていることを知る必要はない。

3:モデルへの経路を制御することで、最適な観測ポイントと、必要に応じてそれを中断するキルスイッチの両方を手に入れる。

4:AIエージェントの思考プロセスを検証できる機能によって、AIエージェントの権限を拡張する。

5:研究所、企業、ハードウェアプロバイダーがそれぞれレイヤーを所有する。AIエージェントランタイムとそのポリシー言語はオープンである必要があり、どのプロバイダーでもプラグインできるようにする必要がある。

NVIDIAのジェンスン・フアンCEOは「私は責任ある楽観主義者です」と述べ、「AIは、発見力、生産性、安全性、健康、そして将来の世代に向けた繁栄を進化させる画期的な技術ですが、その可能性が実現するのは、AIが安全に構築され、賢明かつ責任を持って展開されているという信頼を持てるときだけです。私たちは、最も能力の高いAIだけでなく、最も信頼されるAIを構築しなければなりません。そうしてこそ、この画期的な技術が世界に対する巨大な可能性を実現できるのです」と持論を展開しました。





Anthropicは、NVIDIA OpenShellを活用できる大規模AIエージェント向けAPIスイート「Claude Managed Agents」を発表しています。既に楽天やNotionなどの企業がこれを使用しているとのことです。

Giving companies more control over their AI agents, with NVIDIA | Claude by Anthropic

https://claude.com/blog/giving-companies-more-control-over-their-ai-agents-with-nvidia