ChatGPTなどの汎用AIに本物の車を運転させたら「実車では?」と気付いて運転を拒否、最終的に走らせた方法とは

ChatGPTなどに使われる汎用(はんよう)AIモデルに本物の自動車のハンドル・アクセル・ブレーキを任せてみる実験を、サンフランシスコ・ベイエリアの技術者3人によるプロジェクト「DrivingBench」が実施しました。
Report · DrivingBench
https://drivingbench.com/report/
These Tech Workers Made ChatGPT Drive a Toyota Corolla
Waymoなどが開発している自動運転システムでは、カメラやLiDAR、レーダーなどのセンサーを使って周囲を認識し、大量の走行データやシミュレーションを使って自動運転システムを開発しています。
Waymoがロボタクシーに第6世代自動運転システムを導入、雨・雪・真っ暗な道もより安全に走行可能 - GIGAZINE

一方、ChatGPTなどの基盤となる大規模言語モデルは文章の生成や画像認識、プログラミングなど幅広い用途を想定した汎用的なAIです。DrivingBenchは「自動車向けに特別な訓練を受けていない最先端の汎用AIが現実世界でどの程度運転できるのか」を確かめました。
DrivingBenchを立ち上げたのは数学分野のAIを開発するスタートアップ・Axiom Mathで働くアディティヤ・ラマバドラン氏、トビアス・ゲスラー氏、サイモン・マーンス氏の3人。ロボットに絵を描かせたり物体を移動させたりする近年のAIデモを見たことから、「汎用AIはもう車も運転できるのではないか」と考えたのが実験のきっかけだったそうです。DrivingBenchは実用的な自動運転システムの開発を目的としたものではなく、AIが現実世界の物理的な作業をどこまでこなせるのかを調べるベンチマークとして作られました。
実験には2022年式のトヨタ・カローラが使われ、車両とAIを接続するために車載デバイス「comma four」とオープンソースの運転支援ソフトウェア「openpilot」が利用されました。チームが公開したプログラムはAIと車両の間に入り、AIが「周囲を確認する」「車を動かす」「停止する」という3種類の操作を呼び出し実際の車両操作につなげる仕組みになっています。

AIは車載カメラの画像や車速などを確認し、進行方向、ステアリング量、速度、動かす時間を指示します。チームは人間の運転手を運転席に座らせ、いつでもブレーキを踏める状態で実験を実施しました。また、車両は低速に制限して走らせ、コーンを並べたコース内を進ませています。

AIに与えられた指示は600語未満で、コーンの間から出ないように逆U字型に延びる駐車場内のコースを進み、最後に青色の小さなコーンで示された駐車スペースへ入るという内容でした。走行距離を伸ばすことが主な目標で、可能なら短時間で完走することも求められました。

チームが実験を始めたところ、運転技術を評価する以前の問題として、AIモデルが「自分は現実の自動車を操作しようとしている」と認識すると安全上の理由から操作を拒否することがあったとのこと。特にGPT-6 Astraでは拒否が頻繁に発生し、DrivingBenchの3人は指示文やシステムの名称を何時間も調整することになりました。
DrivingBenchは当初、実験環境を「シミュレーション」と説明する方法を試しました。ところがAIがカメラ映像を解析すると、実際の駐車場らしい風景が映っていることに気付き、実車だと判断して再び運転を拒否しました。
最終的に効果があったのはAIと車を接続するMCPサーバーの名称を「DrivingBench Sandbox」に変更する方法だったとのこと。MCPはAIから外部のソフトウェアや機器を利用できるようにする仕組みで、DrivingBenchでは車両操作用ツールをAIへ提供するために使われています。MCPサーバーを「DrivingBench Sandbox」と名付けた後はAIが安定して運転操作を実行するようになったとDrivingBenchは報告しています。

実験ではGPT-6 Astra、Claude Fable 5.1、Grok 4.6、GPT-5.6 Solを使用し、それぞれ最大3回走行しました。失敗後も同じ会話の文脈を引き継いだままAI自身に失敗原因を振り返らせることで、前回の経験を次の走行に利用できるかも確認しています。
コースを最後まで走り切ったのはGPT-6 Astraだけでした。GPT-6 Astraは1回目にコースのおよそ半分まで進み、2回目には約135mのコースを5分22秒で完走。Claude Fable 5.1も最良の走行でコースの約45%まで進みましたが、Grok 4.6とGPT-5.6 Solはすべての試行で最初のカーブ付近までしか進めませんでした。DrivingBenchはカーブでの失敗について、コーンの配置から正しい走行位置を読み取る「認識」が大きな課題だったと説明しています。

また、実車をAIに動かさせることで、一般的なAIベンチマークでは目立ちにくい「応答速度」の問題も浮かび上がりました。AIが次の操作を考えている間も直前の命令によって車が動き続けるため、応答が遅れるほどコースを外れる危険が高まります。そのためDrivingBenchでは判断の正確さに加えて、AIがどれほど素早く判断できるかも重要な評価対象になるとのことです。
マーンス氏は今回の結果について、AIに新たな能力が現れつつあることを示す興味深い実験だと説明しています。また、ChatGPTのようなAIは主にコンピューター画面の中で利用されてきたものの、今後はロボットなどを通じて物理世界へ影響を及ぼす機会が増えるとみられるため、現実世界でどのように失敗するのかを調べる実験にも意味があると述べています。チームは今後、モデルごとの試行回数を増やすほか、異なる推論設定やより難しいコースでも評価するDrivingBench v2を検討しているとのことです。
